Skip to content

Llama 开源模型系列

本页介绍 LLM 应用生态概览中最重要的开源基座模型家族——Meta Llama 系列:从 2023 年 LLaMA 横空出世打破”大模型只能闭源”的局面,到 Llama 4 开启 MoE 与原生多模态时代,Llama 是推动开源大模型生态繁荣的核心力量。它和 语言模型演进中的 GPT 路线相互呼应,是绝大多数开源微调模型(Alpaca、Vicuna、Code Llama 等)的起点。

Llama 系列 = 开源界的”公共基础设施”。

  • LLaMA = 第一本公开发行的高质量教材:Meta 用公开数据训练出性能逼近 GPT-3 的模型,并免费开放给研究者,从此人人都能研究大模型。
  • Llama 2 = 第一本允许商用的教材:不仅免费看,还能拿去做产品,附带 Chat 对话版本(经过 RLHF 对齐),开源商业落地从此可行。
  • Llama 3 / 3.1 = 一本能在多数考试上打赢闭源尖子生的教材:训练数据扩到 15 万亿 token,405B 版本一度成为当时最强的开源模型。
  • Llama 3.3 = 一本用 1/6 页数(70B)就追平 405B 的精编版:证明后训练优化能大幅缩小参数差距。
  • Llama 4 = 一本按章节分工(MoE)且能看图的多媒体教材:改用混合专家架构降低推理成本,原生支持图文多模态,上下文窗口大幅扩展到千万 token 级别。

LLaMA(2023.2):开创开源大模型时代

Section titled “LLaMA(2023.2):开创开源大模型时代”

Meta 于 2023 年 2 月发布 LLaMA,提供 7B / 13B / 33B / 65B 四个尺寸。它仅授权研究用途(需申请),但权重很快在社区流传,引爆了开源微调浪潮。LLaMA 在架构上并非全新发明,而是把若干已被验证的改进组合到一起,形成了后来 Decoder-only 模型的事实标准:

  • RMSNorm 替代 LayerNorm:去掉 LayerNorm 中的减均值操作,只做缩放归一化,计算更省、训练更稳。
  • SwiGLU 激活函数:将传统 ReLU 替换为带门控的 SwiGLU(用两条支路相乘,一条过 SiLU 激活),提升表达能力。
  • RoPE 旋转位置编码:通过旋转矩阵把相对位置信息注入注意力,无需额外位置嵌入表,且天然支持一定程度的长上下文外推。

Llama 2 是首个允许商业使用的版本(月活用户少于 7 亿可免费商用),提供 7B / 13B / 70B 三个尺寸,并发布了经过 RLHF 对齐的 Llama 2 Chat 对话版本。架构上的关键改进是 GQA(分组查询注意力):

  • 传统多头注意力中,每个头都有独立的 Query、Key、Value 矩阵,推理时需要为每个头缓存 K、V,显存压力大。
  • GQA 让多个 Query 头共享同一组 Key、Value(例如 8 个 Query 头共用 1 组 KV),在几乎不损失效果的情况下显著减小 KV Cache 体积,降低推理显存与访存开销。
  • 极端情况所有 Query 共用一组 KV 即 MQA(Multi-Query Attention),GQA 是它与标准 MHA 之间的折中。

Llama 2 的训练规模约 2 万亿 token,上下文窗口 4K,奠定了”开源可商用 + 对话微调”的范式。

Llama 3 / 3.1(2024):规模与上下文的飞跃

Section titled “Llama 3 / 3.1(2024):规模与上下文的飞跃”

Llama 3(2024.4)发布 8B 与 70B;Llama 3.1(2024.7)进一步推出 405B——当时参数量最大的开源模型,在多项基准上接近 GPT-4o。关键升级:

  • 训练数据 15 万亿 token:远超 Llama 2 的 2 万亿,且质量过滤更严格。
  • 128K 上下文窗口(Llama 3.1):支持长文档理解,配合 RoPE 频率缩放实现长上下文。
  • 词表扩到 128K:从 Llama 2 的 32K 词表大幅扩展,提升多语言与代码压缩率。
  • 全系回归使用 GQA,并在 405B 上验证了”开源模型也能逼近最强闭源模型”。

Llama 3.2 与 Llama 3.3(2024 末):端侧布局与效率突破

Section titled “Llama 3.2 与 Llama 3.3(2024 末):端侧布局与效率突破”

Llama 3.2(2024.9)扩展了产品线,满足不同部署场景:

模型参数量特点适用场景
Llama 3.2 1B1B纯文本,量化后可在手机运行端侧推理、离线助手
Llama 3.2 3B3B纯文本,平衡速度与质量笔记本、边缘设备
Llama 3.2 11B Vision11B图文多模态轻量图像理解
Llama 3.2 90B Vision90B图文多模态企业级视觉推理

其中 1B/3B 是 Llama 首次面向移动端设计的轻量模型,详见 小模型与端侧部署。Vision 版本采用后期融合(late fusion)方案——在文本模型基础上插入预训练的视觉编码器(ViT)适配器,属于”拼接式”多模态,与 Llama 4 的原生多模态路线形成对比。

Llama 3.3 70B Instruct(2024.12)是 Llama 3 系列的收官之作,它以 70B 参数量在多数基准上追平甚至超越 Llama 3.1 405B:

基准测试Llama 3.3 70BLlama 3.1 405B差距
MMLU86.087.3-1.3
GPQA68.966.3+2.6
HumanEval88.489.0-0.6
MATH68.067.2+0.8

这意味着仅通过改进后训练流程(更好的指令微调数据、更强的 RLHF/DPO 对齐、新的奖励模型),Meta 就用 1/6 的参数达到了与最大稠密模型相当的效果。对开发者而言,Llama 3.3 70B 成为性价比极高的选择:推理成本约为 405B 的 1/6,但能力接近。

Llama 4(2025.4):MoE 与原生多模态

Section titled “Llama 4(2025.4):MoE 与原生多模态”

Llama 4 引入了 Llama 系列迄今最大的架构变化,同时发布三个版本:

模型总参数激活参数专家配置上下文窗口模态定位
Llama 4 Scout109B17B16 个专家,每次激活 1 个10M (1000 万)文本 + 图像超长上下文旗舰
Llama 4 Maverick402B17B128 个专家,每次激活 8 个1M (100 万)文本 + 图像综合性能旗舰
Llama 4 Behemoth~2T(预估)~288B更大规模 MoE—文本 + 图像教师模型(仍在训练)

Llama 4 的 Mixture of Experts(混合专家) 架构改变了”所有参数都参与每次计算”的传统稠密模型范式:

核心机制是:

  • 前馈网络(FFN)替换为专家池:每个 Transformer 层的 FFN 被替换为一组并行的 FFN(即”专家”)。Scout 有 16 个专家,每次路由到其中 1 个;Maverick 有 128 个专家,每次路由到 top-8。
  • 路由器决定走哪条路:一个轻量的路由网络(通常就是一个线性层 + softmax)为每个 token 计算所有专家的得分,选择得分最高的若干专家处理该 token。
  • 稀疏激活 = 算力节省:以 Maverick 为例,402B 总参数但每次推理只激活 17B,推理算力相当于一个 17B 的稠密模型,却拥有 402B 参数的表达能力。这解释了为何 MoE 能在不爆炸推理成本的前提下大幅提升模型容量。
  • 代价是显存:虽然计算量低,但所有专家的权重都必须驻留在显存中(因为不同 token 可能路由到任何专家)。Maverick 需要约 800GB+ FP16 显存加载全部权重,远高于激活参数所暗示的规模。

Llama 4 之前,大多数多模态方案采用 后期融合(Late Fusion):先训练好文本模型,再训练一个独立的视觉编码器(如 ViT),最后用一个适配器把视觉特征”翻译”成文本模型能理解的格式。这类似于”先培养一个纯文本专家,再给它配一副眼镜”。

Llama 4 选择 早期融合(Early Fusion):

在 Early Fusion 中,图像被切分为若干 Patch(小块),每个 Patch 像一个”视觉 token”一样与文本 token 在同一模型中从预训练第一天就一起训练。好处是模型从一开始就学习图文交叉的语义关联(例如”图中红色的物体”这种跨模态引用),而非事后拼接。这与 多模态大模型中讨论的融合策略属于同一路线。

iRoPE:面向超长上下文的位置编码

Section titled “iRoPE:面向超长上下文的位置编码”

Scout 支持高达 1000 万 token 的上下文窗口,这对位置编码提出了极大挑战。传统 RoPE 在超出训练长度后注意力分数急剧衰减。Llama 4 引入 iRoPE(Interleaved RoPE,交错旋转位置编码):

  • 将 Transformer 层交错分组:一部分层使用标准 RoPE 注入位置信息,另一部分层不使用任何位置编码(NoPE,No Position Embedding)。
  • NoPE 层让模型在超长序列中依赖内容本身(语义相似性)而非位置距离来决定注意力分配,相当于”不在乎词在第几个位置,只在乎它说了什么”。
  • RoPE 层则在需要局部顺序信息的场景(如语法、代码缩进)中提供精确的相对位置。
  • 两者交错配合,兼顾长距离语义关联与短距离位置精度。

Llama 4 Maverick 在发布时号称在 LMSYS 人类偏好评测(Chatbot Arena)上超越了 GPT-4o 和 DeepSeek V3,不过社区对其部分评测指标存在争议(Meta 被指使用了非标准的评测设置)。总体而言,Llama 4 在通用对话、多模态理解上达到了第一梯队水平,但在复杂推理(如 AIME 数学竞赛)上仍落后于 Claude 3.5 Sonnet 和 DeepSeek R1 等专注于推理的模型。

架构组件深入:为什么这些设计很重要

Section titled “架构组件深入:为什么这些设计很重要”

Llama 系列采用的核心组件后来成为几乎所有开源大模型的事实标准。理解它们”为什么有效”比记住名字更重要。

RMSNorm:为什么去掉减均值也能工作

Section titled “RMSNorm:为什么去掉减均值也能工作”

传统 LayerNorm 做两件事:(1)减去均值(零中心化),(2)除以标准差(缩放)。RMSNorm 只做第二步——用均方根(Root Mean Square)做缩放:

RMSNorm(x)=x1d∑i=1dxi2+ϵ⋅γ\text{RMSNorm}(x) = \frac{x}{\sqrt{\frac{1}{d}\sum_{i=1}^{d} x_i^2 + \epsilon}} \cdot \gamma

为什么去掉减均值仍然有效?研究者发现 LayerNorm 中起关键作用的是缩放归一化(让不同维度的尺度一致),减均值对最终效果的贡献很小。去掉它意味着:

  • 省掉一次全向量减法和均值计算,减少约 7%—64% 的归一化计算开销。
  • 在深层网络中累积的计算节省相当可观——Llama 70B 有 80 层,每层有多个 RMSNorm。

几乎所有后 LLaMA 时代的模型(Qwen、Mistral、DeepSeek 等)都采用了 RMSNorm。

标准 Transformer 的 FFN 使用两层线性变换加 ReLU 激活:FFN(x)=ReLU(xW1)W2\text{FFN}(x) = \text{ReLU}(xW_1) W_2。LLaMA 引入的 SwiGLU 改为三路变换:

SwiGLU(x)=(Swish(xW)⊗xV)W2\text{SwiGLU}(x) = (\text{Swish}(xW) \otimes xV) W_2

其中 Swish(x)=x⋅σ(x)\text{Swish}(x) = x \cdot \sigma(x)(σ\sigma 是 sigmoid),⊗\otimes 是逐元素乘法。直觉是:

  • xWxW 支路过 Swish 激活——这是”信息通路”,决定输出什么。
  • xVxV 支路不做非线性变换——这是”门控信号”,决定每个维度的信息能通过多少。
  • 两者逐元素相乘,等于让模型自己学习”每个维度该开多大阀门”,比 ReLU 的”非 0 即 1 硬开关”更灵活。

代价是 FFN 参数量增加 1/3(三个权重矩阵 W,V,W2W, V, W_2 而非两个 W1,W2W_1, W_2),但效果提升值得这个代价。

传统位置编码(如原始 Transformer 的 sinusoidal)是加法操作——把位置向量加到 token 嵌入上。RoPE(Rotary Position Embedding)改用乘法——对 Query 和 Key 向量做旋转:

关键数学性质:两个旋转后的向量做点积,结果只依赖它们的角度差(即相对位置 m−nm - n),而非绝对位置。这意味着:

  • 模型天然编码”这两个词隔了多远”而非”这个词在第几个位置”,更符合语言中相对距离比绝对位置更重要的直觉。
  • 不需要额外的位置嵌入表(对比可学习位置嵌入),省参数。
  • 长上下文外推时可通过调整旋转基频率(如 NTK-aware scaling、YaRN)来扩展有效范围。

GQA 对推理显存的影响可以用具体数字说明。以 Llama 2 70B 为例:

  • 配置:80 层,64 个注意力头,头维度 128。
  • 不使用 GQA(MHA):64 个 Query 头 × 64 个 KV 头。KV Cache 大小 = 2 (K+V) × 64 头 × 128 维 × 80 层 × seq_len × batch × 2 字节(FP16)。
  • 使用 GQA:64 个 Query 头 × 8 个 KV 头。KV Cache 大小减少为 8/64 = 1/8。

以 seq_len=4096, batch=1 为例:

配置KV 头数KV Cache 大小倍率
MHA(无 GQA)64~10.5 GB1×
GQA(8 组)8~1.3 GB1/8
MQA(极端)1~0.16 GB1/64

在长上下文场景(128K token),KV Cache 往往成为推理瓶颈,GQA 带来的 8 倍削减是决定性的——它使得在单机 8×A100 上运行 70B 模型成为可能。

Llama 谱系把多个改进逐步固化为业界标配:RMSNorm、SwiGLU、RoPE(从 LLaMA 起),GQA(从 Llama 2 起),再到 MoE 与原生多模态(Llama 4)。理解这些组件的最好方式是回到 Transformer 架构和注意力机制。

Llama 4 发布时,开源 LLM 生态已远非 Llama 一家独大。以下对比帮助理解 Llama 在当前格局中的位置:

模型来源架构总参数 / 激活参数上下文核心优势许可证
Llama 4 MaverickMetaMoE + 多模态402B / 17B1M原生多模态、生态成熟Llama 4 社区许可
Llama 4 ScoutMetaMoE + 多模态109B / 17B10M超长上下文Llama 4 社区许可
Llama 3.3 70BMeta稠密70B / 70B128K高性价比、稳定可靠Llama 3 社区许可
DeepSeek V3深度求索MoE671B / 37B128K极致训练成本、代码强MIT(完全开放)
DeepSeek R1深度求索MoE + RL 推理671B / 37B128K开源推理模型(对标 o1)MIT
Qwen 2.5 / Qwen 3阿里稠密 / MoE0.5B—72B+128K尺寸全覆盖、中文最强Apache 2.0
Mistral Large 2Mistral AI稠密123B128K欧洲代表、代码能力强Mistral 研究许可
Mixtral 8x22BMistral AIMoE141B / 39B64K早期开源 MoE 先驱Apache 2.0
GLM-4 / GLM-4.5智谱 AI稠密 / MoE多尺寸128K中英双语、Agent 能力MIT / 开放

几个值得关注的趋势:

  • MoE 成为主流:Llama 4、DeepSeek V3、Mixtral 等新一代旗舰都不约而同采用 MoE,稠密大模型(>100B)正在变少。MoE 让”大参数、小激活”成为可能,以更低推理成本支撑更强能力。
  • DeepSeek 的冲击:DeepSeek V3 以极低训练成本(约 557 万美元 GPU 租用费)训练出接近 GPT-4o 的模型,打破了”大模型必须烧天价”的认知;R1 则证明了开源模型也能通过 RL(强化学习)获得强大的 Chain-of-Thought 推理能力,详见 推理模型。
  • 中国力量崛起:DeepSeek、Qwen(阿里)、GLM(智谱)在多项基准上与 Llama 4 平分秋色,尤其在中英文双语、数学推理等方向。Qwen 以从 0.5B 到 72B+ 的全覆盖策略,在端侧和企业部署中广泛采用。
  • 许可证分化:Llama 的社区许可有月活 7 亿门槛和使用政策限制,而 DeepSeek、Qwen 采用更宽松的 MIT/Apache 2.0。对需要最大商业自由度的企业,后者更具吸引力。

Llama 作为开源基座催生了大量衍生模型,覆盖编程、安全、视觉、领域专精等方向:

衍生模型基座用途说明
Code LlamaLlama 2代码生成与补全用 500B token 代码数据继续训练,提供 7B/13B/34B 及 Python 专精版
Llama Guard / Meta Llama Guard 3Llama 2 / 3内容安全分类器输入输出安全审查,检测违规内容,输出结构化安全标签
Llama Guard 4Llama 4多模态安全分类支持图文双重安全审查
Llama 3.2 VisionLlama 3.2 11B/90B图文理解后期融合 ViT 视觉编码器,支持图像问答
Prompt GuardLlama 系列Prompt 注入检测检测恶意指令注入与越狱攻击
AlpacaLLaMA 7B指令微调Stanford 用自生成指令数据微调,成本约 600 美元
VicunaLLaMA 13B对话微调用 ShareGPT 真实对话数据微调,长对话质量优秀
WizardCoder / PhindCode Llama代码助手在 Code Llama 基础上做 Evol-Instruct 增强指令微调

其中 Llama Guard 系列值得特别说明:它本质上是一个用 Llama 微调的安全分类器——输入一段文本(用户消息或模型回复),输出”安全 / 不安全”标签以及违规类别(如暴力、仇恨、色情等)。它不是聊天模型,而是部署在应用层与 LLM 之间的安全过滤器,详见 安全与对齐和 护栏系统。

Llama 的开放权重使得社区微调(fine-tuning)生态极其繁荣。以下是 2025 年主流的微调工具与框架:

工具特点适合场景
Unsloth对反向传播和注意力做手写 Triton kernel 优化,LoRA 微调速度提升 2×、显存降低 60%+单卡/少卡快速 LoRA 微调
AxolotlYAML 配置驱动,支持多种数据格式和训练方法(LoRA/QLoRA/全量/DPO)标准化、可复现的训练流程
LLaMA-Factory国产、中文文档完善、Web UI 可视化操作,支持数十种模型初学者、快速实验
PEFT / TRLHuggingFace 官方工具链,LoRA/QLoRA 的底层实现需要深度定制的训练管线
TorchtunePyTorch 官方微调库,原生支持 Llama 全系研究、需要 PyTorch 原生体验

微调方法方面,PEFT 方法中的 LoRA(低秩适配)和 QLoRA(量化 + LoRA)是绝对主流:它们冻结原模型权重,只训练少量适配器参数,使得在单张消费级 GPU 上微调 70B 模型成为可能。常见的社区微调方向包括:

  • 中文能力增强:用高质量中文对话数据微调,弥补 Llama 原生中文偏弱的短板。
  • 领域专精:医疗、法律、金融等领域数据微调,生成行业专家模型。
  • 角色扮演与人格定制:用特定风格对话数据微调,打造个性化 AI 助手。

详见 LLM 微调实践。

以下为各尺寸 Llama 模型的典型部署硬件需求(FP16,不含 KV Cache 和系统开销):

模型参数量FP16 显存INT8 显存INT4 显存推荐配置
Llama 3.2 1B1B~2 GB~1 GB~0.6 GB任意现代设备
Llama 3.2 3B3B~6 GB~3 GB~1.8 GB单张消费级 GPU
Llama 3.1 8B8B~16 GB~8 GB~5 GBRTX 4090 / A10
Llama 3.3 70B70B~140 GB~70 GB~40 GB2×A100 80G (量化) 或 4×A100
Llama 4 Scout109B (MoE)~220 GB~110 GB~60 GB3×A100 80G (INT8)
Llama 4 Maverick402B (MoE)~800 GB+~400 GB~220 GB8×A100 80G / H100 集群

注意:MoE 模型(Scout/Maverick)的总参数量决定显存需求,而非激活参数量。Maverick 虽然只激活 17B,但 402B 全部权重必须常驻显存。

量化(Quantization)是压缩模型、降低部署门槛的关键手段,详见 推理优化技术:

量化格式精度损失适用框架特点
GGUF (Q4_K_M 等)较小llama.cpp / OllamaCPU/GPU 混合,端侧首选
GPTQ小vLLM / TransformersGPU 推理,精度-速度平衡好
AWQ很小vLLM / TGI激活感知量化,精度最优
FP8极小vLLM / TensorRT-LLM需要 H100/L40S 等原生 FP8 硬件
引擎定位优势适合场景
vLLM高吞吐 GPU 推理PagedAttention + Continuous Batching,生态最全生产环境 GPU 服务
SGLang高性能 GPU 推理RadixAttention,结构化输出极快Agent、复杂调用模式
TensorRT-LLMNVIDIA 极致优化编译期优化,延迟最低NVIDIA 硬件、极致延迟要求
llama.cpp轻量全平台纯 C++,无依赖,CPU/GPU 混合边缘、本地、离线
Ollama一键本地运行封装 llama.cpp,CLI 极简开发者本地体验、原型验证

详见 LLM 推理。

版本许可证商用关键限制
LLaMA非商业研究许可否仅限研究用途
Llama 2Llama 2 社区许可是月活用户少于 7 亿免费,超出需另签协议
Llama 3 / 3.1 / 3.2 / 3.3Llama 3 社区许可是月活超 7 亿需授权,另有使用政策限制
Llama 4Llama 4 社区许可是沿用社区许可模式,欧盟用户有额外限制
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
# 加载 Llama 3.2 小尺寸模型(1B,适合单卡体验)
model_id = "meta-llama/Llama-3.2-1B-Instruct"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.float16, device_map="auto"
)
# 构造对话消息(Llama 3 使用专用对话模板)
messages = [{"role": "user", "content": "用一句话解释什么是 RoPE 位置编码"}]
input_ids = tok.apply_chat_template(
messages, add_generation_prompt=True, return_tensors="pt"
).to(model.device)
# 自回归生成
with torch.no_grad():
out = model.generate(input_ids, max_new_tokens=60, do_sample=True, temperature=0.7)
print(tok.decode(out[0][input_ids.shape[1]:], skip_special_tokens=True))

使用 Ollama 一行命令本地运行(适合快速体验):

Terminal window
# 下载并运行 Llama 3.2(自动量化为 Q4)
ollama run llama3.2
# 运行 Llama 3.3 70B(需要 ~40GB 显存或足够内存做 CPU 推理)
ollama run llama3.3
  • 看清许可证再商用:Llama 2 起虽可商用,但有月活 7 亿门槛和使用政策(如限制某些场景),企业落地前务必核对最新许可条款。对需要完全自由的场景,考虑 DeepSeek(MIT)或 Qwen(Apache 2.0)。
  • Llama 3.2 系列含 1B/3B 轻量版:面向端侧与移动设备,配合量化(GGUF/INT4)可在手机本地运行,详见 小模型与端侧部署。
  • Chat 版才适合对话:基础版(Base)只做文本续写,直接用于问答体验差;做助手请用 Instruct/Chat 版本,或基于它做 微调。
  • 推理部署首选 vLLM / llama.cpp:vLLM 通过 PagedAttention + Continuous Batching 大幅提升吞吐(见 推理优化技术);llama.cpp 适合 CPU/边缘部署。
  • 微调 Llama 是入门捷径:用 PEFT 在单卡上微调 Llama 3.2 1B/3B,是学习大模型定制最经济的路径。Unsloth 和 LLaMA-Factory 能进一步降低门槛。
  • MoE 模型部署注意显存:Llama 4 的 Scout/Maverick 虽然激活参数只有 17B,但总权重很大。部署前按总参数量规划显存,不要被”17B 激活”误导。
  • 长上下文需配合 KV Cache 优化:Scout 的 10M 上下文需要配合 KV Cache 量化、PagedAttention 等技术,否则显存开销极其巨大。
  • 企业私有助手:金融、政务、医疗等数据敏感行业在 Llama 基座上用内部数据微调,模型完全本地部署,避免数据外泄。
  • 代码助手:Code Llama 及其衍生模型(如 Phind、WizardCoder)用于代码补全、缺陷修复,是开源版 Copilot 的基座。
  • 边缘与离线场景:Llama 3.2 1B/3B 量化后部署在笔记本、手机,实现无网络环境下的本地问答与翻译。
  • 内容安全审核:Llama Guard 系列部署在 LLM 应用的输入输出层,自动过滤违规内容,是生产级 AI 应用的标配安全组件。
  • 研究与教育:Llama 是学术界研究模型机理、对齐方法、推理增强的标准对象,无数论文以其为基座。
类库语言说明
transformersPythonHuggingFace 出品,加载 Llama 全系权重、对话模板与推理接口
vLLMPython高吞吐推理引擎,PagedAttention + Continuous Batching,Llama 部署首选
SGLangPython高性能推理引擎,RadixAttention 加速复杂调用模式
llama.cppC++C++ 实现的轻量推理框架,支持 GGUF 量化,CPU/GPU 混合,适合边缘部署
OllamaGo一键本地运行 Llama 等开源模型的工具,封装 llama.cpp,命令行极简
UnslothPython手写 Triton kernel 加速 LoRA 微调,速度提升 2×、显存降低 60%+
AxolotlPythonYAML 配置驱动的微调框架,支持 LoRA/QLoRA/DPO 等多种方法
PEFT / TRLPythonHuggingFace 微调工具链,LoRA/QLoRA 微调 Llama 的标配
术语英文解释
分组查询注意力GQA, Grouped-Query Attention多个 Query 头共享一组 KV,减少 KV Cache、降低推理开销
旋转位置编码RoPE, Rotary Position Embedding用旋转矩阵注入相对位置信息,无需额外位置嵌入表
交错旋转位置编码iRoPE, Interleaved RoPELlama 4 引入,交错使用 RoPE 层与无位置编码(NoPE)层以支持超长上下文
SwiGLUSwiGLU Activation带门控的前馈激活函数,LLaMA 起被广泛采用
RMSNormRoot Mean Square Normalization省去均值的归一化方式,比 LayerNorm 更省算力
混合专家MoE, Mixture of Experts稀疏激活架构,每次只激活部分专家子网络,Llama 4 采用
早期融合Early Fusion从预训练阶段就将多模态信号统一编码联合训练,而非后期拼接
门控线性单元GLU, Gated Linear Units用一条支路做门控信号调制另一条支路的机制,SwiGLU 是其变体
社区许可Community LicenseMeta 的自定义许可,允许商用但有月活门槛与使用政策
指令微调Instruction Tuning用指令-回答数据让模型学会听从人类指令(如 Alpaca)
量化Quantization降低权重精度(如 FP16→INT4)以压缩模型体积、减少推理开销
KV CacheKV Cache自回归推理时缓存的 Key/Value 张量,GQA 和量化可大幅削减其体积
路由器RouterMoE 中决定每个 token 激活哪些专家的小型网络
  • Touvron et al.,「LLaMA: Open and Efficient Foundation Language Models」(2023):LLaMA 原始论文,首次系统组合 RoPE/SwiGLU/RMSNorm 并以可负担算力逼近闭源模型。
  • Touvron et al.,「Llama 2: Open Foundation and Fine-Tuned Chat Models」(2023):引入 GQA 与 RLHF 对齐的 Chat 版本,确立开源可商用范式。
  • Meta,「The Llama 3 Herd of Models」(2024):15 万亿 token 训练、128K 上下文、405B 规模,详细披露数据与对齐流程。
  • Meta,「The Llama 4 Herd: The Beginning of a New Era of Natively Multimodal AI」(2025):Llama 4 官方博客,首次披露 MoE 架构、Early Fusion 多模态、iRoPE 长上下文方案。
  • DeepSeek-AI,「DeepSeek-V3 Technical Report」(2024):671B MoE、37B 激活,以极低训练成本逼近 GPT-4o,是理解 MoE 工程实践的重要参考。
  • Su et al.,「RoFormer: Enhanced Transformer with Rotary Position Embedding」(2021):RoPE 原始论文,详细推导旋转位置编码的数学性质。
  • Shazeer,「GLU Variants Improve Transformer」(2020):SwiGLU 的来源,系统比较各种门控激活函数。
  • Stanford Alpaca:低成本的 LLaMA 指令微调示范,证明几百美元即可获得接近 GPT-3.5 的对话能力。
  • 更多模型选型对比见模型选型指南,多模态方向见多模态大模型,推理优化技术见推理优化技术。