Llama 开源模型系列
本页介绍 LLM 应用生态概览中最重要的开源基座模型家族——Meta Llama 系列:从 2023 年 LLaMA 横空出世打破”大模型只能闭源”的局面,到 Llama 4 开启 MoE 与原生多模态时代,Llama 是推动开源大模型生态繁荣的核心力量。它和 语言模型演进中的 GPT 路线相互呼应,是绝大多数开源微调模型(Alpaca、Vicuna、Code Llama 等)的起点。
Llama 系列 = 开源界的”公共基础设施”。
- LLaMA = 第一本公开发行的高质量教材:Meta 用公开数据训练出性能逼近 GPT-3 的模型,并免费开放给研究者,从此人人都能研究大模型。
- Llama 2 = 第一本允许商用的教材:不仅免费看,还能拿去做产品,附带 Chat 对话版本(经过 RLHF 对齐),开源商业落地从此可行。
- Llama 3 / 3.1 = 一本能在多数考试上打赢闭源尖子生的教材:训练数据扩到 15 万亿 token,405B 版本一度成为当时最强的开源模型。
- Llama 3.3 = 一本用 1/6 页数(70B)就追平 405B 的精编版:证明后训练优化能大幅缩小参数差距。
- Llama 4 = 一本按章节分工(MoE)且能看图的多媒体教材:改用混合专家架构降低推理成本,原生支持图文多模态,上下文窗口大幅扩展到千万 token 级别。
LLaMA(2023.2):开创开源大模型时代
Section titled “LLaMA(2023.2):开创开源大模型时代”Meta 于 2023 年 2 月发布 LLaMA,提供 7B / 13B / 33B / 65B 四个尺寸。它仅授权研究用途(需申请),但权重很快在社区流传,引爆了开源微调浪潮。LLaMA 在架构上并非全新发明,而是把若干已被验证的改进组合到一起,形成了后来 Decoder-only 模型的事实标准:
- RMSNorm 替代 LayerNorm:去掉 LayerNorm 中的减均值操作,只做缩放归一化,计算更省、训练更稳。
- SwiGLU 激活函数:将传统 ReLU 替换为带门控的 SwiGLU(用两条支路相乘,一条过 SiLU 激活),提升表达能力。
- RoPE 旋转位置编码:通过旋转矩阵把相对位置信息注入注意力,无需额外位置嵌入表,且天然支持一定程度的长上下文外推。
Llama 2(2023.7):商用开放与 GQA
Section titled “Llama 2(2023.7):商用开放与 GQA”Llama 2 是首个允许商业使用的版本(月活用户少于 7 亿可免费商用),提供 7B / 13B / 70B 三个尺寸,并发布了经过 RLHF 对齐的 Llama 2 Chat 对话版本。架构上的关键改进是 GQA(分组查询注意力):
- 传统多头注意力中,每个头都有独立的 Query、Key、Value 矩阵,推理时需要为每个头缓存 K、V,显存压力大。
- GQA 让多个 Query 头共享同一组 Key、Value(例如 8 个 Query 头共用 1 组 KV),在几乎不损失效果的情况下显著减小 KV Cache 体积,降低推理显存与访存开销。
- 极端情况所有 Query 共用一组 KV 即 MQA(Multi-Query Attention),GQA 是它与标准 MHA 之间的折中。
Llama 2 的训练规模约 2 万亿 token,上下文窗口 4K,奠定了”开源可商用 + 对话微调”的范式。
Llama 3 / 3.1(2024):规模与上下文的飞跃
Section titled “Llama 3 / 3.1(2024):规模与上下文的飞跃”Llama 3(2024.4)发布 8B 与 70B;Llama 3.1(2024.7)进一步推出 405B——当时参数量最大的开源模型,在多项基准上接近 GPT-4o。关键升级:
- 训练数据 15 万亿 token:远超 Llama 2 的 2 万亿,且质量过滤更严格。
- 128K 上下文窗口(Llama 3.1):支持长文档理解,配合 RoPE 频率缩放实现长上下文。
- 词表扩到 128K:从 Llama 2 的 32K 词表大幅扩展,提升多语言与代码压缩率。
- 全系回归使用 GQA,并在 405B 上验证了”开源模型也能逼近最强闭源模型”。
Llama 3.2 与 Llama 3.3(2024 末):端侧布局与效率突破
Section titled “Llama 3.2 与 Llama 3.3(2024 末):端侧布局与效率突破”Llama 3.2(2024.9)扩展了产品线,满足不同部署场景:
| 模型 | 参数量 | 特点 | 适用场景 |
|---|---|---|---|
| Llama 3.2 1B | 1B | 纯文本,量化后可在手机运行 | 端侧推理、离线助手 |
| Llama 3.2 3B | 3B | 纯文本,平衡速度与质量 | 笔记本、边缘设备 |
| Llama 3.2 11B Vision | 11B | 图文多模态 | 轻量图像理解 |
| Llama 3.2 90B Vision | 90B | 图文多模态 | 企业级视觉推理 |
其中 1B/3B 是 Llama 首次面向移动端设计的轻量模型,详见 小模型与端侧部署。Vision 版本采用后期融合(late fusion)方案——在文本模型基础上插入预训练的视觉编码器(ViT)适配器,属于”拼接式”多模态,与 Llama 4 的原生多模态路线形成对比。
Llama 3.3 70B Instruct(2024.12)是 Llama 3 系列的收官之作,它以 70B 参数量在多数基准上追平甚至超越 Llama 3.1 405B:
| 基准测试 | Llama 3.3 70B | Llama 3.1 405B | 差距 |
|---|---|---|---|
| MMLU | 86.0 | 87.3 | -1.3 |
| GPQA | 68.9 | 66.3 | +2.6 |
| HumanEval | 88.4 | 89.0 | -0.6 |
| MATH | 68.0 | 67.2 | +0.8 |
这意味着仅通过改进后训练流程(更好的指令微调数据、更强的 RLHF/DPO 对齐、新的奖励模型),Meta 就用 1/6 的参数达到了与最大稠密模型相当的效果。对开发者而言,Llama 3.3 70B 成为性价比极高的选择:推理成本约为 405B 的 1/6,但能力接近。
Llama 4(2025.4):MoE 与原生多模态
Section titled “Llama 4(2025.4):MoE 与原生多模态”Llama 4 引入了 Llama 系列迄今最大的架构变化,同时发布三个版本:
| 模型 | 总参数 | 激活参数 | 专家配置 | 上下文窗口 | 模态 | 定位 |
|---|---|---|---|---|---|---|
| Llama 4 Scout | 109B | 17B | 16 个专家,每次激活 1 个 | 10M (1000 万) | 文本 + 图像 | 超长上下文旗舰 |
| Llama 4 Maverick | 402B | 17B | 128 个专家,每次激活 8 个 | 1M (100 万) | 文本 + 图像 | 综合性能旗舰 |
| Llama 4 Behemoth | ~2T(预估) | ~288B | 更大规模 MoE | — | 文本 + 图像 | 教师模型(仍在训练) |
MoE 架构详解
Section titled “MoE 架构详解”Llama 4 的 Mixture of Experts(混合专家) 架构改变了”所有参数都参与每次计算”的传统稠密模型范式:
核心机制是:
- 前馈网络(FFN)替换为专家池:每个 Transformer 层的 FFN 被替换为一组并行的 FFN(即”专家”)。Scout 有 16 个专家,每次路由到其中 1 个;Maverick 有 128 个专家,每次路由到 top-8。
- 路由器决定走哪条路:一个轻量的路由网络(通常就是一个线性层 + softmax)为每个 token 计算所有专家的得分,选择得分最高的若干专家处理该 token。
- 稀疏激活 = 算力节省:以 Maverick 为例,402B 总参数但每次推理只激活 17B,推理算力相当于一个 17B 的稠密模型,却拥有 402B 参数的表达能力。这解释了为何 MoE 能在不爆炸推理成本的前提下大幅提升模型容量。
- 代价是显存:虽然计算量低,但所有专家的权重都必须驻留在显存中(因为不同 token 可能路由到任何专家)。Maverick 需要约 800GB+ FP16 显存加载全部权重,远高于激活参数所暗示的规模。
原生多模态:Early Fusion
Section titled “原生多模态:Early Fusion”Llama 4 之前,大多数多模态方案采用 后期融合(Late Fusion):先训练好文本模型,再训练一个独立的视觉编码器(如 ViT),最后用一个适配器把视觉特征”翻译”成文本模型能理解的格式。这类似于”先培养一个纯文本专家,再给它配一副眼镜”。
Llama 4 选择 早期融合(Early Fusion):
在 Early Fusion 中,图像被切分为若干 Patch(小块),每个 Patch 像一个”视觉 token”一样与文本 token 在同一模型中从预训练第一天就一起训练。好处是模型从一开始就学习图文交叉的语义关联(例如”图中红色的物体”这种跨模态引用),而非事后拼接。这与 多模态大模型中讨论的融合策略属于同一路线。
iRoPE:面向超长上下文的位置编码
Section titled “iRoPE:面向超长上下文的位置编码”Scout 支持高达 1000 万 token 的上下文窗口,这对位置编码提出了极大挑战。传统 RoPE 在超出训练长度后注意力分数急剧衰减。Llama 4 引入 iRoPE(Interleaved RoPE,交错旋转位置编码):
- 将 Transformer 层交错分组:一部分层使用标准 RoPE 注入位置信息,另一部分层不使用任何位置编码(NoPE,No Position Embedding)。
- NoPE 层让模型在超长序列中依赖内容本身(语义相似性)而非位置距离来决定注意力分配,相当于”不在乎词在第几个位置,只在乎它说了什么”。
- RoPE 层则在需要局部顺序信息的场景(如语法、代码缩进)中提供精确的相对位置。
- 两者交错配合,兼顾长距离语义关联与短距离位置精度。
Llama 4 Maverick 在发布时号称在 LMSYS 人类偏好评测(Chatbot Arena)上超越了 GPT-4o 和 DeepSeek V3,不过社区对其部分评测指标存在争议(Meta 被指使用了非标准的评测设置)。总体而言,Llama 4 在通用对话、多模态理解上达到了第一梯队水平,但在复杂推理(如 AIME 数学竞赛)上仍落后于 Claude 3.5 Sonnet 和 DeepSeek R1 等专注于推理的模型。
架构组件深入:为什么这些设计很重要
Section titled “架构组件深入:为什么这些设计很重要”Llama 系列采用的核心组件后来成为几乎所有开源大模型的事实标准。理解它们”为什么有效”比记住名字更重要。
RMSNorm:为什么去掉减均值也能工作
Section titled “RMSNorm:为什么去掉减均值也能工作”传统 LayerNorm 做两件事:(1)减去均值(零中心化),(2)除以标准差(缩放)。RMSNorm 只做第二步——用均方根(Root Mean Square)做缩放:
为什么去掉减均值仍然有效?研究者发现 LayerNorm 中起关键作用的是缩放归一化(让不同维度的尺度一致),减均值对最终效果的贡献很小。去掉它意味着:
- 省掉一次全向量减法和均值计算,减少约 7%—64% 的归一化计算开销。
- 在深层网络中累积的计算节省相当可观——Llama 70B 有 80 层,每层有多个 RMSNorm。
几乎所有后 LLaMA 时代的模型(Qwen、Mistral、DeepSeek 等)都采用了 RMSNorm。
SwiGLU:门控激活的数学
Section titled “SwiGLU:门控激活的数学”标准 Transformer 的 FFN 使用两层线性变换加 ReLU 激活:。LLaMA 引入的 SwiGLU 改为三路变换:
其中 ( 是 sigmoid), 是逐元素乘法。直觉是:
- 支路过 Swish 激活——这是”信息通路”,决定输出什么。
- 支路不做非线性变换——这是”门控信号”,决定每个维度的信息能通过多少。
- 两者逐元素相乘,等于让模型自己学习”每个维度该开多大阀门”,比 ReLU 的”非 0 即 1 硬开关”更灵活。
代价是 FFN 参数量增加 1/3(三个权重矩阵 而非两个 ),但效果提升值得这个代价。
RoPE:用旋转编码相对位置
Section titled “RoPE:用旋转编码相对位置”传统位置编码(如原始 Transformer 的 sinusoidal)是加法操作——把位置向量加到 token 嵌入上。RoPE(Rotary Position Embedding)改用乘法——对 Query 和 Key 向量做旋转:
关键数学性质:两个旋转后的向量做点积,结果只依赖它们的角度差(即相对位置 ),而非绝对位置。这意味着:
- 模型天然编码”这两个词隔了多远”而非”这个词在第几个位置”,更符合语言中相对距离比绝对位置更重要的直觉。
- 不需要额外的位置嵌入表(对比可学习位置嵌入),省参数。
- 长上下文外推时可通过调整旋转基频率(如 NTK-aware scaling、YaRN)来扩展有效范围。
GQA:KV Cache 削减的实际计算
Section titled “GQA:KV Cache 削减的实际计算”GQA 对推理显存的影响可以用具体数字说明。以 Llama 2 70B 为例:
- 配置:80 层,64 个注意力头,头维度 128。
- 不使用 GQA(MHA):64 个 Query 头 × 64 个 KV 头。KV Cache 大小 =
2 (K+V) × 64 头 × 128 维 × 80 层 × seq_len × batch × 2 字节(FP16)。 - 使用 GQA:64 个 Query 头 × 8 个 KV 头。KV Cache 大小减少为
8/64 = 1/8。
以 seq_len=4096, batch=1 为例:
| 配置 | KV 头数 | KV Cache 大小 | 倍率 |
|---|---|---|---|
| MHA(无 GQA) | 64 | ~10.5 GB | 1× |
| GQA(8 组) | 8 | ~1.3 GB | 1/8 |
| MQA(极端) | 1 | ~0.16 GB | 1/64 |
在长上下文场景(128K token),KV Cache 往往成为推理瓶颈,GQA 带来的 8 倍削减是决定性的——它使得在单机 8×A100 上运行 70B 模型成为可能。
架构演进小结
Section titled “架构演进小结”Llama 谱系把多个改进逐步固化为业界标配:RMSNorm、SwiGLU、RoPE(从 LLaMA 起),GQA(从 Llama 2 起),再到 MoE 与原生多模态(Llama 4)。理解这些组件的最好方式是回到 Transformer 架构和注意力机制。
2025 年开源大模型格局
Section titled “2025 年开源大模型格局”Llama 4 发布时,开源 LLM 生态已远非 Llama 一家独大。以下对比帮助理解 Llama 在当前格局中的位置:
| 模型 | 来源 | 架构 | 总参数 / 激活参数 | 上下文 | 核心优势 | 许可证 |
|---|---|---|---|---|---|---|
| Llama 4 Maverick | Meta | MoE + 多模态 | 402B / 17B | 1M | 原生多模态、生态成熟 | Llama 4 社区许可 |
| Llama 4 Scout | Meta | MoE + 多模态 | 109B / 17B | 10M | 超长上下文 | Llama 4 社区许可 |
| Llama 3.3 70B | Meta | 稠密 | 70B / 70B | 128K | 高性价比、稳定可靠 | Llama 3 社区许可 |
| DeepSeek V3 | 深度求索 | MoE | 671B / 37B | 128K | 极致训练成本、代码强 | MIT(完全开放) |
| DeepSeek R1 | 深度求索 | MoE + RL 推理 | 671B / 37B | 128K | 开源推理模型(对标 o1) | MIT |
| Qwen 2.5 / Qwen 3 | 阿里 | 稠密 / MoE | 0.5B—72B+ | 128K | 尺寸全覆盖、中文最强 | Apache 2.0 |
| Mistral Large 2 | Mistral AI | 稠密 | 123B | 128K | 欧洲代表、代码能力强 | Mistral 研究许可 |
| Mixtral 8x22B | Mistral AI | MoE | 141B / 39B | 64K | 早期开源 MoE 先驱 | Apache 2.0 |
| GLM-4 / GLM-4.5 | 智谱 AI | 稠密 / MoE | 多尺寸 | 128K | 中英双语、Agent 能力 | MIT / 开放 |
几个值得关注的趋势:
- MoE 成为主流:Llama 4、DeepSeek V3、Mixtral 等新一代旗舰都不约而同采用 MoE,稠密大模型(>100B)正在变少。MoE 让”大参数、小激活”成为可能,以更低推理成本支撑更强能力。
- DeepSeek 的冲击:DeepSeek V3 以极低训练成本(约 557 万美元 GPU 租用费)训练出接近 GPT-4o 的模型,打破了”大模型必须烧天价”的认知;R1 则证明了开源模型也能通过 RL(强化学习)获得强大的 Chain-of-Thought 推理能力,详见 推理模型。
- 中国力量崛起:DeepSeek、Qwen(阿里)、GLM(智谱)在多项基准上与 Llama 4 平分秋色,尤其在中英文双语、数学推理等方向。Qwen 以从 0.5B 到 72B+ 的全覆盖策略,在端侧和企业部署中广泛采用。
- 许可证分化:Llama 的社区许可有月活 7 亿门槛和使用政策限制,而 DeepSeek、Qwen 采用更宽松的 MIT/Apache 2.0。对需要最大商业自由度的企业,后者更具吸引力。
衍生模型与生态
Section titled “衍生模型与生态”Llama 作为开源基座催生了大量衍生模型,覆盖编程、安全、视觉、领域专精等方向:
重要衍生模型一览
Section titled “重要衍生模型一览”| 衍生模型 | 基座 | 用途 | 说明 |
|---|---|---|---|
| Code Llama | Llama 2 | 代码生成与补全 | 用 500B token 代码数据继续训练,提供 7B/13B/34B 及 Python 专精版 |
| Llama Guard / Meta Llama Guard 3 | Llama 2 / 3 | 内容安全分类器 | 输入输出安全审查,检测违规内容,输出结构化安全标签 |
| Llama Guard 4 | Llama 4 | 多模态安全分类 | 支持图文双重安全审查 |
| Llama 3.2 Vision | Llama 3.2 11B/90B | 图文理解 | 后期融合 ViT 视觉编码器,支持图像问答 |
| Prompt Guard | Llama 系列 | Prompt 注入检测 | 检测恶意指令注入与越狱攻击 |
| Alpaca | LLaMA 7B | 指令微调 | Stanford 用自生成指令数据微调,成本约 600 美元 |
| Vicuna | LLaMA 13B | 对话微调 | 用 ShareGPT 真实对话数据微调,长对话质量优秀 |
| WizardCoder / Phind | Code Llama | 代码助手 | 在 Code Llama 基础上做 Evol-Instruct 增强指令微调 |
其中 Llama Guard 系列值得特别说明:它本质上是一个用 Llama 微调的安全分类器——输入一段文本(用户消息或模型回复),输出”安全 / 不安全”标签以及违规类别(如暴力、仇恨、色情等)。它不是聊天模型,而是部署在应用层与 LLM 之间的安全过滤器,详见 安全与对齐和 护栏系统。
Llama 的开放权重使得社区微调(fine-tuning)生态极其繁荣。以下是 2025 年主流的微调工具与框架:
| 工具 | 特点 | 适合场景 |
|---|---|---|
| Unsloth | 对反向传播和注意力做手写 Triton kernel 优化,LoRA 微调速度提升 2×、显存降低 60%+ | 单卡/少卡快速 LoRA 微调 |
| Axolotl | YAML 配置驱动,支持多种数据格式和训练方法(LoRA/QLoRA/全量/DPO) | 标准化、可复现的训练流程 |
| LLaMA-Factory | 国产、中文文档完善、Web UI 可视化操作,支持数十种模型 | 初学者、快速实验 |
| PEFT / TRL | HuggingFace 官方工具链,LoRA/QLoRA 的底层实现 | 需要深度定制的训练管线 |
| Torchtune | PyTorch 官方微调库,原生支持 Llama 全系 | 研究、需要 PyTorch 原生体验 |
微调方法方面,PEFT 方法中的 LoRA(低秩适配)和 QLoRA(量化 + LoRA)是绝对主流:它们冻结原模型权重,只训练少量适配器参数,使得在单张消费级 GPU 上微调 70B 模型成为可能。常见的社区微调方向包括:
- 中文能力增强:用高质量中文对话数据微调,弥补 Llama 原生中文偏弱的短板。
- 领域专精:医疗、法律、金融等领域数据微调,生成行业专家模型。
- 角色扮演与人格定制:用特定风格对话数据微调,打造个性化 AI 助手。
详见 LLM 微调实践。
部署实践指南
Section titled “部署实践指南”硬件需求参考
Section titled “硬件需求参考”以下为各尺寸 Llama 模型的典型部署硬件需求(FP16,不含 KV Cache 和系统开销):
| 模型 | 参数量 | FP16 显存 | INT8 显存 | INT4 显存 | 推荐配置 |
|---|---|---|---|---|---|
| Llama 3.2 1B | 1B | ~2 GB | ~1 GB | ~0.6 GB | 任意现代设备 |
| Llama 3.2 3B | 3B | ~6 GB | ~3 GB | ~1.8 GB | 单张消费级 GPU |
| Llama 3.1 8B | 8B | ~16 GB | ~8 GB | ~5 GB | RTX 4090 / A10 |
| Llama 3.3 70B | 70B | ~140 GB | ~70 GB | ~40 GB | 2×A100 80G (量化) 或 4×A100 |
| Llama 4 Scout | 109B (MoE) | ~220 GB | ~110 GB | ~60 GB | 3×A100 80G (INT8) |
| Llama 4 Maverick | 402B (MoE) | ~800 GB+ | ~400 GB | ~220 GB | 8×A100 80G / H100 集群 |
注意:MoE 模型(Scout/Maverick)的总参数量决定显存需求,而非激活参数量。Maverick 虽然只激活 17B,但 402B 全部权重必须常驻显存。
量化(Quantization)是压缩模型、降低部署门槛的关键手段,详见 推理优化技术:
| 量化格式 | 精度损失 | 适用框架 | 特点 |
|---|---|---|---|
| GGUF (Q4_K_M 等) | 较小 | llama.cpp / Ollama | CPU/GPU 混合,端侧首选 |
| GPTQ | 小 | vLLM / Transformers | GPU 推理,精度-速度平衡好 |
| AWQ | 很小 | vLLM / TGI | 激活感知量化,精度最优 |
| FP8 | 极小 | vLLM / TensorRT-LLM | 需要 H100/L40S 等原生 FP8 硬件 |
推理引擎选型
Section titled “推理引擎选型”| 引擎 | 定位 | 优势 | 适合场景 |
|---|---|---|---|
| vLLM | 高吞吐 GPU 推理 | PagedAttention + Continuous Batching,生态最全 | 生产环境 GPU 服务 |
| SGLang | 高性能 GPU 推理 | RadixAttention,结构化输出极快 | Agent、复杂调用模式 |
| TensorRT-LLM | NVIDIA 极致优化 | 编译期优化,延迟最低 | NVIDIA 硬件、极致延迟要求 |
| llama.cpp | 轻量全平台 | 纯 C++,无依赖,CPU/GPU 混合 | 边缘、本地、离线 |
| Ollama | 一键本地运行 | 封装 llama.cpp,CLI 极简 | 开发者本地体验、原型验证 |
详见 LLM 推理。
| 版本 | 许可证 | 商用 | 关键限制 |
|---|---|---|---|
| LLaMA | 非商业研究许可 | 否 | 仅限研究用途 |
| Llama 2 | Llama 2 社区许可 | 是 | 月活用户少于 7 亿免费,超出需另签协议 |
| Llama 3 / 3.1 / 3.2 / 3.3 | Llama 3 社区许可 | 是 | 月活超 7 亿需授权,另有使用政策限制 |
| Llama 4 | Llama 4 社区许可 | 是 | 沿用社区许可模式,欧盟用户有额外限制 |
Llama 谱系演进
Section titled “Llama 谱系演进”LLaMA 关键架构组件
Section titled “LLaMA 关键架构组件”MoE vs 稠密模型对比
Section titled “MoE vs 稠密模型对比”from transformers import AutoModelForCausalLM, AutoTokenizerimport torch
# 加载 Llama 3.2 小尺寸模型(1B,适合单卡体验)model_id = "meta-llama/Llama-3.2-1B-Instruct"tok = AutoTokenizer.from_pretrained(model_id)model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype=torch.float16, device_map="auto")
# 构造对话消息(Llama 3 使用专用对话模板)messages = [{"role": "user", "content": "用一句话解释什么是 RoPE 位置编码"}]input_ids = tok.apply_chat_template( messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
# 自回归生成with torch.no_grad(): out = model.generate(input_ids, max_new_tokens=60, do_sample=True, temperature=0.7)print(tok.decode(out[0][input_ids.shape[1]:], skip_special_tokens=True))使用 Ollama 一行命令本地运行(适合快速体验):
# 下载并运行 Llama 3.2(自动量化为 Q4)ollama run llama3.2
# 运行 Llama 3.3 70B(需要 ~40GB 显存或足够内存做 CPU 推理)ollama run llama3.3- 看清许可证再商用:Llama 2 起虽可商用,但有月活 7 亿门槛和使用政策(如限制某些场景),企业落地前务必核对最新许可条款。对需要完全自由的场景,考虑 DeepSeek(MIT)或 Qwen(Apache 2.0)。
- Llama 3.2 系列含 1B/3B 轻量版:面向端侧与移动设备,配合量化(GGUF/INT4)可在手机本地运行,详见 小模型与端侧部署。
- Chat 版才适合对话:基础版(Base)只做文本续写,直接用于问答体验差;做助手请用 Instruct/Chat 版本,或基于它做 微调。
- 推理部署首选 vLLM / llama.cpp:vLLM 通过 PagedAttention + Continuous Batching 大幅提升吞吐(见 推理优化技术);llama.cpp 适合 CPU/边缘部署。
- 微调 Llama 是入门捷径:用 PEFT 在单卡上微调 Llama 3.2 1B/3B,是学习大模型定制最经济的路径。Unsloth 和 LLaMA-Factory 能进一步降低门槛。
- MoE 模型部署注意显存:Llama 4 的 Scout/Maverick 虽然激活参数只有 17B,但总权重很大。部署前按总参数量规划显存,不要被”17B 激活”误导。
- 长上下文需配合 KV Cache 优化:Scout 的 10M 上下文需要配合 KV Cache 量化、PagedAttention 等技术,否则显存开销极其巨大。
- 企业私有助手:金融、政务、医疗等数据敏感行业在 Llama 基座上用内部数据微调,模型完全本地部署,避免数据外泄。
- 代码助手:Code Llama 及其衍生模型(如 Phind、WizardCoder)用于代码补全、缺陷修复,是开源版 Copilot 的基座。
- 边缘与离线场景:Llama 3.2 1B/3B 量化后部署在笔记本、手机,实现无网络环境下的本地问答与翻译。
- 内容安全审核:Llama Guard 系列部署在 LLM 应用的输入输出层,自动过滤违规内容,是生产级 AI 应用的标配安全组件。
- 研究与教育:Llama 是学术界研究模型机理、对齐方法、推理增强的标准对象,无数论文以其为基座。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| transformers | Python | HuggingFace 出品,加载 Llama 全系权重、对话模板与推理接口 |
| vLLM | Python | 高吞吐推理引擎,PagedAttention + Continuous Batching,Llama 部署首选 |
| SGLang | Python | 高性能推理引擎,RadixAttention 加速复杂调用模式 |
| llama.cpp | C++ | C++ 实现的轻量推理框架,支持 GGUF 量化,CPU/GPU 混合,适合边缘部署 |
| Ollama | Go | 一键本地运行 Llama 等开源模型的工具,封装 llama.cpp,命令行极简 |
| Unsloth | Python | 手写 Triton kernel 加速 LoRA 微调,速度提升 2×、显存降低 60%+ |
| Axolotl | Python | YAML 配置驱动的微调框架,支持 LoRA/QLoRA/DPO 等多种方法 |
| PEFT / TRL | Python | HuggingFace 微调工具链,LoRA/QLoRA 微调 Llama 的标配 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 分组查询注意力 | GQA, Grouped-Query Attention | 多个 Query 头共享一组 KV,减少 KV Cache、降低推理开销 |
| 旋转位置编码 | RoPE, Rotary Position Embedding | 用旋转矩阵注入相对位置信息,无需额外位置嵌入表 |
| 交错旋转位置编码 | iRoPE, Interleaved RoPE | Llama 4 引入,交错使用 RoPE 层与无位置编码(NoPE)层以支持超长上下文 |
| SwiGLU | SwiGLU Activation | 带门控的前馈激活函数,LLaMA 起被广泛采用 |
| RMSNorm | Root Mean Square Normalization | 省去均值的归一化方式,比 LayerNorm 更省算力 |
| 混合专家 | MoE, Mixture of Experts | 稀疏激活架构,每次只激活部分专家子网络,Llama 4 采用 |
| 早期融合 | Early Fusion | 从预训练阶段就将多模态信号统一编码联合训练,而非后期拼接 |
| 门控线性单元 | GLU, Gated Linear Units | 用一条支路做门控信号调制另一条支路的机制,SwiGLU 是其变体 |
| 社区许可 | Community License | Meta 的自定义许可,允许商用但有月活门槛与使用政策 |
| 指令微调 | Instruction Tuning | 用指令-回答数据让模型学会听从人类指令(如 Alpaca) |
| 量化 | Quantization | 降低权重精度(如 FP16→INT4)以压缩模型体积、减少推理开销 |
| KV Cache | KV Cache | 自回归推理时缓存的 Key/Value 张量,GQA 和量化可大幅削减其体积 |
| 路由器 | Router | MoE 中决定每个 token 激活哪些专家的小型网络 |
- Touvron et al.,「LLaMA: Open and Efficient Foundation Language Models」(2023):LLaMA 原始论文,首次系统组合 RoPE/SwiGLU/RMSNorm 并以可负担算力逼近闭源模型。
- Touvron et al.,「Llama 2: Open Foundation and Fine-Tuned Chat Models」(2023):引入 GQA 与 RLHF 对齐的 Chat 版本,确立开源可商用范式。
- Meta,「The Llama 3 Herd of Models」(2024):15 万亿 token 训练、128K 上下文、405B 规模,详细披露数据与对齐流程。
- Meta,「The Llama 4 Herd: The Beginning of a New Era of Natively Multimodal AI」(2025):Llama 4 官方博客,首次披露 MoE 架构、Early Fusion 多模态、iRoPE 长上下文方案。
- DeepSeek-AI,「DeepSeek-V3 Technical Report」(2024):671B MoE、37B 激活,以极低训练成本逼近 GPT-4o,是理解 MoE 工程实践的重要参考。
- Su et al.,「RoFormer: Enhanced Transformer with Rotary Position Embedding」(2021):RoPE 原始论文,详细推导旋转位置编码的数学性质。
- Shazeer,「GLU Variants Improve Transformer」(2020):SwiGLU 的来源,系统比较各种门控激活函数。
- Stanford Alpaca:低成本的 LLaMA 指令微调示范,证明几百美元即可获得接近 GPT-3.5 的对话能力。
- 更多模型选型对比见模型选型指南,多模态方向见多模态大模型,推理优化技术见推理优化技术。