ChatGPT 与 Claude 深度拆解
本页深度拆解 OpenAI ChatGPT 与 Anthropic Claude——当今最具影响力的两大对话式 AI 产品:从底层模型架构到训练流水线,从多模态融合到工具调用与 Agent 能力,理解它们”是怎么做到的”,以及在 2025-2026 年的产品演进与商业竞争格局。
这些产品是什么
Section titled “这些产品是什么”ChatGPT 是 OpenAI 于 2022 年 11 月推出的对话式 AI 助手,底层模型经历了 GPT-3.5 → GPT-4 → GPT-4o → o1/o3(推理模型)→ GPT-5(2025 年 8 月)→ GPT-5.2(2025 年 12 月)的演进。它从一个”聊天机器人”成长为支持多模态、工具调用、代码执行、自主 Agent 的通用 AI 平台。截至 2025 年底,ChatGPT 已拥有超过 2000 万付费订阅用户,OpenAI 2025 年全年营收约 131 亿美元。
Claude 是 Anthropic 推出的对话式 AI 助手,经历了 Claude 2 → Claude 3(Haiku/Sonnet/Opus)→ Claude 3.5 Sonnet → Claude 4 系列(Sonnet 4 / Opus 4,2025 年 5 月)→ Opus 4.5/4.6/4.7/4.8(2025-2026)→ Claude Sonnet 5(2026 年 6 月,100 万 token 上下文)→ Claude Opus 5(2026 年 7 月)的演进。Claude 的标志性特征是 Constitutional AI(宪法 AI) 对齐方法、超长上下文窗口,以及 Artifacts、Computer Use、Claude Code、Claude Cowork 等创新交互形态。
两者本质都是大规模 Transformer 语言模型 + 多阶段训练 + 系统工程优化的产物。(Transformer 是一种基于”注意力机制”的神经网络架构,能让模型理解序列中元素之间的关系,是目前所有主流大语言模型的底座——详见 Transformer 架构。)差异在于:
- 训练对齐路线不同:OpenAI 采用 RLHF + RL(强化学习迭代),Anthropic 采用 Constitutional AI(AI 自我反馈对齐)。RLHF 是”人类反馈强化学习”——用人类标注的偏好数据训练一个奖励模型,再用强化学习算法优化语言模型;Constitutional AI 则让模型根据一组”宪法原则”自己生成偏好数据,减少对人类标注的依赖。
- 上下文策略不同:Claude 主打超长上下文(从 200K token 一路扩展到 Sonnet 5 的 100 万 token),GPT 侧重多模态原生融合与推理路由。
- 产品形态演进不同:ChatGPT 走向 GPT Store / GPTs / Agent / Atlas 浏览器生态,Claude 走向 Artifacts / Computer Use / Claude Code / MCP 协议 / Claude Cowork 桌面 Agent 生态。
- 商业模式不同:OpenAI 采用”免费引流 + 订阅 + 企业许可 + API 计费 + 广告”的多元收入模型;Anthropic 则更专注”订阅 + API + 企业/政府合同”,并因拒绝将 Claude 用于大规模国内监控而与美国国防部发生冲突。
技术架构拆解
Section titled “技术架构拆解”ChatGPT 整体架构
Section titled “ChatGPT 整体架构”GPT-5 的关键架构创新是路由系统(Router):它不再要求用户手动选择模型,而是由一个实时路由器根据对话类型、复杂度、工具需求自动决定使用快速高吞吐模型(gpt-5-main)还是深度推理模型(gpt-5-thinking)。这是对 GPT-4o 时代”手动选模型”体验的根本性简化——用户只需对话,系统自动判断何时需要”多想一会儿”。
Claude 整体架构
Section titled “Claude 整体架构”Claude 的架构亮点是上下文工程与MCP 协议。MCP(Model Context Protocol,模型上下文协议)是 Anthropic 于 2024 年底开源的标准协议,让 Claude 能以统一方式连接外部数据源、工具和服务——类似于 AI 应用层的”USB 接口”。详见 MCP 协议与工具调用。
关键技术点详解
Section titled “关键技术点详解”1. GPT-5 架构与原生多模态融合
Section titled “1. GPT-5 架构与原生多模态融合”GPT-4o 的”o”代表 omni(全能),首次实现原生多模态——文本、图像、音频共享同一个 Transformer 骨干网络,而非分别编码后拼接。GPT-5 在此基础上更进一步:视觉和文本能力在整个训练过程中同步发展,而非像 GPT-4 那样先训练语言模型再接入视觉模块。
原生多模态的实际意义是:模型能直接”听懂”语音并”说话”,端到端延迟低至约 232ms(GPT-4o),接近人类对话反应速度(约 200ms)。GPT-5 将语音模式统一升级为”ChatGPT Voice”,取代了旧的 Advanced Voice Mode,支持更自然的对话节奏。
术语解释——多模态融合:让 AI 同时处理文本、图像、音频等多种输入/输出形式,并将它们统一映射到同一个”表示空间”中,使模型能跨模态理解(比如”看图说话”或”听音生成”)。
2. 推理模型与思维链
Section titled “2. 推理模型与思维链”2024 年底开始,OpenAI 和 Anthropic 都推出了推理模型(reasoning model)——模型在回答前先进行内部”思维链”(Chain-of-Thought)推理,逐步拆解复杂问题。OpenAI 的 o1/o3 系列和 GPT-5 的 thinking 变体都属于此类;Claude 则从 3.7 Sonnet 开始引入”extended thinking”(扩展思维)能力。
推理模型的核心思想:在推理时(inference time)投入更多计算资源,让模型”多想几步”,而不是只在训练时堆参数。这类似于让一个聪明人在考试时打草稿,而不是凭直觉答题。详见 推理模型 和 推理技术。
3. 训练流水线:预训练 → SFT → RLHF / Constitutional AI
Section titled “3. 训练流水线:预训练 → SFT → RLHF / Constitutional AI”两者的基础训练流程相似,但对齐阶段策略不同:
- 预训练(Pre-training):在万亿级 token 上学习语言规律,产出 base 模型。这一步让模型学会”语言的统计规律”——下一个词最可能是什么。详见 语言模型演进 和 预训练架构。
- 监督微调(SFT, Supervised Fine-Tuning):用高质量人工对话数据微调,让模型学会”对话”格式和指令遵循。
- RLHF:OpenAI 用人类偏好数据训练奖励模型,再用 PPO(近端策略优化)优化策略。详见 RLHF 与 LLM 训练。
- Constitutional AI:Anthropic 让模型根据一组”宪法原则”自己生成偏好数据(自我批评 + 修订),减少对人类标注的依赖。2026 年版的 Claude 宪法已从 2023 年的约 2700 字扩展到 23000 字,包含更详尽的行为准则和推理依据。
术语解释——对齐(Alignment):让 AI 模型的行为符合人类价值观和意图,避免产生有害、欺骗性或违背伦理的输出。这是 AI 安全的核心议题,详见 安全与对齐。
4. 工具调用与 Function Calling
Section titled “4. 工具调用与 Function Calling”两者都支持结构化的工具调用——模型输出 JSON 格式的函数调用请求,由外部系统执行后把结果返回给模型。这是 AI Agent(智能体)的基础能力:模型不再只是”说”,而是能”做”——查数据库、调 API、执行代码、操作文件系统。
术语解释——Agent:能自主规划任务、调用工具、根据反馈调整策略的 AI 系统。不同于单轮问答,Agent 能进行多步骤的复杂操作。详见 AI Agent 与多智能体 和 Agent 模式。
详见 MCP 协议与工具调用 和 结构化输出。
5. Code Interpreter、Artifacts 与代码沙箱
Section titled “5. Code Interpreter、Artifacts 与代码沙箱”ChatGPT 的 Code Interpreter 让模型能生成并执行 Python 代码,在沙箱(sandbox,即隔离的安全执行环境)中运行后返回结果(图表、数据分析等)。Claude 的 Artifacts 则在界面上实时渲染模型生成的代码(HTML/React 组件、SVG 图形等),让用户直接看到效果。
到了 2025-2026 年,两者的代码能力都大幅进化:
- OpenAI Codex:独立的编码 Agent,能处理多文件项目、自主调试,并支持发布为托管网站(Sites 功能)。
- Claude Code:2025 年 2 月发布的命令行编码 Agent,能直接在终端中接受自然语言指令完成编码任务。2025 年 7 月营收增长 5.5 倍,被微软、Google 甚至 OpenAI 员工内部使用。
- Claude Cowork:2026 年 1 月发布的图形界面 Agent,面向非技术用户,能访问本地文件系统、执行代码、串联多步骤任务。
详见 AI 编码工具 和 Cursor 与 Copilot。
6. Claude Computer Use 与桌面 Agent
Section titled “6. Claude Computer Use 与桌面 Agent”Claude 3.5 Sonnet 引入的 Computer Use 能力,让模型能”看到”屏幕截图并输出鼠标点击/键盘输入指令——本质是将 GUI(图形用户界面)操作建模为一种特殊的工具调用。技术上是截图 → 视觉理解 → 坐标推理 → 动作序列。
到 2026 年,这一能力演进为 Claude Cowork 的”Dispatch”功能:用户可以从手机发送指令,Claude 在电脑上操作浏览器、电子表格等应用完成任务。这标志着 AI 从”对话助手”向”数字员工”的转变。
7. 推理优化与流式输出
Section titled “7. 推理优化与流式输出”两者都使用流式输出(SSE,Server-Sent Events)让用户感受到”逐字打字”的效果,大幅降低首 token 延迟(即用户等待第一个字符出现的时间)。
术语解释——流式推理:模型不是等整个回答全部生成完再返回,而是每生成一个 token(文本的最小单位,约 3/4 个英文单词)就立即推送给用户。虽然总生成时间不变,但用户感知的等待大幅缩短。详见 流式输出与 SSE 和 推理优化。
底层推理涉及 KV Cache(键值缓存,缓存已计算过的注意力中间结果避免重复计算)、量化(quantization,降低模型参数精度以减少内存和计算开销)、投机解码(speculative decoding,用小模型快速草拟、大模型验证)等优化。详见 LLM 推理优化。
ChatGPT 多模态对话(OpenAI API)
Section titled “ChatGPT 多模态对话(OpenAI API)”from openai import OpenAI
client = OpenAI() # 需设置环境变量 OPENAI_API_KEY
# 多模态对话:文本 + 图片response = client.chat.completions.create( model="gpt-5", # 2025 年 8 月起可用 messages=[ {"role": "system", "content": "你是一位前端架构师,给出简洁建议"}, {"role": "user", "content": [ {"type": "text", "text": "用 React 写一个倒计时组件"}, ]}, ], stream=True, # 流式输出,逐 token 返回)
# 逐块打印,模拟 ChatGPT 打字效果for chunk in response: delta = chunk.choices[0].delta.content if delta: print(delta, end="", flush=True)Claude Function Calling(Anthropic API)
Section titled “Claude Function Calling(Anthropic API)”import anthropic
client = anthropic.Anthropic() # 需设置环境变量 ANTHROPIC_API_KEY
# 定义工具:让 Claude 能查天气tools = [{ "name": "get_weather", "description": "查询指定城市的天气", "input_schema": { "type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"], },}]
# 发送请求,Claude 自主决定是否调用工具response = client.messages.create( model="claude-sonnet-4-20250514", # 或更新的 claude-sonnet-5-... max_tokens=1024, tools=tools, messages=[{"role": "user", "content": "北京今天天气怎么样?"}],)
# 检查 Claude 是否要调用工具if response.stop_reason == "tool_use": print("Claude 决定调用 get_weather 工具") for block in response.content: if block.type == "tool_use": print(f"参数: {block.input}") # 如 {'city': '北京'}商业模式与竞争格局
Section titled “商业模式与竞争格局”OpenAI:多元收入 + 基础设施野心
Section titled “OpenAI:多元收入 + 基础设施野心”OpenAI 采用分层的商业模式:
| 层级 | 产品 | 定价(2025-2026) | 目标用户 |
|---|---|---|---|
| 免费 | ChatGPT(GPT-5 有限额度) | 免费 | 引流、数据收集 |
| 个人订阅 | ChatGPT Plus | $20/月 | 高频个人用户 |
| 高级订阅 | ChatGPT Pro | $200/月 | 专业用户、无限量访问 |
| 团队 | ChatGPT Team | $25-30/人/月 | 中小团队 |
| 企业 | ChatGPT Enterprise | 定制 | 大型企业 |
| 开发者 | API | 按 token 计费 | 应用开发者 |
| 广告 | ChatGPT 搜索广告 | 2026 年启动 | 搜索用户 |
OpenAI 2025 年营收约 131 亿美元(2024 年仅 37 亿),但仍有约 90 亿美元运营亏损——主要消耗在算力成本上。公司预计 2029 年实现现金流为正,2030 年营收目标约 2000 亿美元。
融资与估值里程碑:
- 2024 年 10 月:157 亿美元估值,融资 66 亿美元
- 2025 年 4 月:3000 亿美元估值,融资 400 亿美元(SoftBank 领投)
- 2025 年 10 月:5000 亿美元估值(超过 SpaceX,成全球最有价值私人公司)
- 2026 年 2 月:7300 亿美元估值,融资 1100 亿美元(Amazon 500 亿 + SoftBank 300 亿 + Nvidia 300 亿)
- 2026 年 4 月:8520 亿美元估值,承诺资本 1220 亿美元
- 2026 年 6 月:正式提交 IPO 申请
基础设施布局:OpenAI 通过 Stargate 项目(与 Oracle、SoftBank 合资,计划投资 5000 亿美元建设 AI 基础设施)、与 Broadcom 合作自研 AI 芯片(代号 Jalapeño,2026 年底开始部署)、以及与 AMD 签署数十亿美元芯片协议,试图降低对 Nvidia GPU 的依赖。
Anthropic:专注产品力 + 安全品牌
Section titled “Anthropic:专注产品力 + 安全品牌”Anthropic 的商业模式更聚焦:
| 层级 | 产品 | 定价(2025-2026) | 说明 |
|---|---|---|---|
| 免费 | Claude.ai(有限额度) | 免费 | 引流 |
| 个人 | Claude Pro | $20/月 | 高级模型访问 |
| 高级 | Claude Max | $100-200/月 | 更高用量限制 |
| 团队 | Claude Team | $30/人/月 | 协作功能 |
| 企业 | Claude Enterprise | 定制 | 企业部署 |
| 政府 | Claude Gov | 定制 | 情报/国防专用模型 |
| 开发者 | API | 按 token 计费 | 含 Claude Code |
Anthropic 的差异化竞争力在于安全品牌和编码能力。Claude Code 在 2025 年下半年到 2026 年初的假期期间”出圈”爆红——大量非程序员用它进行 vibe coding(凭直觉用自然语言描述需求让 AI 生成应用)。Anthropic 还推出了 Claude Design(视觉设计工具)、Claude Science(科研专用模型)等垂直产品线。
政府冲突事件(2026 年):Anthropic 因拒绝允许 Claude 被用于大规模国内监控和完全自主武器,被美国国防部列为”供应链风险”,联邦机构被要求在六个月内停用 Claude。2026 年 3 月,联邦法官 Rita F. Lin 发布临时禁令阻止该决定,称其”看起来是典型的第一修正案报复”。微软、Google 等公司提交了支持 Anthropic 的法律意见书。
竞争格局速览
Section titled “竞争格局速览”| 维度 | OpenAI / ChatGPT | Anthropic / Claude | Google / Gemini |
|---|---|---|---|
| 模型迭代速度 | 快(GPT-5 → 5.2 → …) | 快(4 → 4.8 → 5 系列) | 中(Gemini 2.5 → 3) |
| 多模态 | 原生文/图/音 | 文/图(音频待跟进) | 原生文/图/音/视频 |
| 上下文窗口 | 128K-400K | 100 万 tokens(Sonnet 5) | 100 万-200 万 tokens |
| 编码能力 | Codex / GPT-5 | Claude Code(口碑领先) | Gemini Code Assist |
| Agent 能力 | ChatGPT Agent / Operator | Claude Cowork / Computer Use | Project Astra |
| 生态开放度 | 相对封闭 | MCP 协议开源 | 居中 |
| 安全品牌 | 削弱(高管离职潮) | 领先(Constitutional AI) | 中等 |
此外,xAI 的 Grok、Meta 的 Llama(开源)、DeepSeek(中国,开源)等也在快速追赶,整个市场从”双雄争霸”演变为”多极竞争”。
- 模型选择:简单对话/分类任务用小模型(GPT-4o mini / Claude Haiku)即可,复杂推理用旗舰模型。GPT-5 的路由系统会自动选择,但 API 开发者仍需手动指定。详见 模型选择指南 和 小模型。
- 上下文窗口不是越大越好:Claude 100 万 token 和 GPT-4o 128K 上下文中,信息密度会随长度下降(“lost in the middle”问题——中间位置的信息容易被模型忽略)。关键信息放在开头和结尾。详见 上下文工程。
- 结构化输出优先:需要程序解析的结果,用
response_format(OpenAI JSON mode)或工具调用,不要靠正则解析自由文本。详见 结构化输出。 - 流式输出改善体验:即使总时间不变,逐 token 返回让用户感知等待大幅缩短。详见 流式输出与SSE。
- 安全护栏:生产环境务必加输入/输出过滤。详见 AI 安全与护栏。
- 成本控制:推理模型(thinking 变体)的 token 消耗远高于普通模型,建议仅在复杂推理场景使用。善用 prompt 缓存(prompt caching)可大幅降低重复请求成本。
典型应用场景
Section titled “典型应用场景”- 编程辅助:ChatGPT 的 Codex / Canvas 做数据分析与代码编写;Claude Code 在终端中完成从原型到部署的全流程。详见 Cursor 与 Copilot 和 AI 编码工具。
- 文档分析与总结:Claude 的超长上下文(最高 100 万 token,约等于几本长篇小说)适合整本书/长合同/大型代码库分析;GPT-4o/5 适合图文混排文档理解。
- Agent 自动化:两者都支持工具调用构建 Agent,自动完成搜索、代码执行、文件操作等任务。Claude Cowork 和 ChatGPT Agent 代表了”桌面 Agent”的新范式。详见 AI Agent 与多智能体。
- 多模态交互:GPT-5 的实时语音对话适合语言学习、客服等场景;Claude 的 Computer Use / Cowork 适合自动化 GUI 操作。
- 企业知识库:结合 RAG(Retrieval-Augmented Generation,检索增强生成——先从知识库中检索相关文档,再让 LLM 基于检索结果生成回答)技术,将内部文档接入对话系统。详见 RAG 检索增强生成。
- AI 搜索:ChatGPT Search / Shopping 和 Claude 的 Web Search 功能正在挑战 Google 的搜索霸权。详见 AI 搜索 和 Perplexity 搜索。
技术选型建议
Section titled “技术选型建议”| 场景 | 推荐选择 | 理由 |
|---|---|---|
| 通用对话/写作 | 两者皆可,看偏好 | 能力接近,Claude 文风更自然,GPT 更”听话” |
| 复杂代码项目 | Claude Code / Sonnet | 编码口碑领先,长上下文适合大代码库 |
| 数据分析 | ChatGPT Code Interpreter | 内置 Python 沙箱,直接出图表 |
| 超长文档处理 | Claude(100 万 token) | 上下文窗口碾压级优势 |
| 实时语音交互 | GPT-5 ChatGPT Voice | 原生语音输入输出,延迟低 |
| GUI 自动化 | Claude Cowork / Computer Use | 屏幕操作能力更成熟 |
| 构建多工具 Agent | 两者皆可 | OpenAI 生态更大,MCP 协议更开放 |
| 成本敏感场景 | 小模型(Haiku / GPT-4o mini) | 性价比最高,详见 小模型 |
| 需要开源/私有部署 | DeepSeek / Llama | 两者都是闭源 SaaS |
API 对比
Section titled “API 对比”| 维度 | OpenAI(GPT-5) | Anthropic(Claude) |
|---|---|---|
| 上下文窗口 | 128K-400K tokens | 最高 100 万 tokens(Sonnet 5) |
| 多模态输入 | 文本 + 图片 + 音频 | 文本 + 图片 |
| 多模态输出 | 文本 + 音频 | 文本 |
| 推理模型 | GPT-5 thinking(可调 effort) | Claude extended thinking |
| 工具调用 | Function Calling | Tool Use + MCP |
| 代码执行 | Codex / Code Interpreter | Artifacts / Claude Code |
| 对齐方法 | RLHF + RL | Constitutional AI |
| 流式输出 | SSE | SSE |
| 结构化输出 | JSON Mode / Structured Outputs | Tool Use / JSON schema |
| 开源生态 | GPT-OSS(2025.8 开放权重) | MCP 协议(开源标准) |
典型类库与工具
Section titled “典型类库与工具”| 工具 | 语言 | 说明 |
|---|---|---|
| openai | Python/JS | OpenAI 官方 SDK,支持对话、工具调用、流式输出 |
| anthropic | Python/JS | Anthropic 官方 SDK,支持对话、工具调用、Computer Use |
| LangChain | Python/JS | LLM 应用框架,封装多模型调用、工具链、Agent |
| LiteLLM | Python | 统一调用 100+ 模型的代理层,一行代码切换 OpenAI/Claude |
| Vercel AI SDK | JS/TS | 前端友好的流式 AI SDK,支持 React Server Components |
2025-2026 最新进展速览
Section titled “2025-2026 最新进展速览”OpenAI 关键事件
Section titled “OpenAI 关键事件”- 2025.1:发布 Operator(AI Agent)和 Deep Research(深度研究 Agent)
- 2025.4:融资 400 亿美元,估值 3000 亿美元
- 2025.8.5:发布 GPT-OSS(两个开放权重推理模型)
- 2025.8.7:发布 GPT-5——原生多模态、路由系统、“safe completions”安全策略
- 2025.10:转为公共利益公司(PBC)结构;估值 5000 亿美元
- 2025.10.21:发布 ChatGPT Atlas(内置 ChatGPT 的 AI 浏览器)
- 2025.11:ChatGPT 购物研究功能上线
- 2025.12.11:发布 GPT-5.2
- 2026.2:融资 1100 亿美元,估值 7300 亿美元
- 2026.6:提交 IPO 申请;发布自研芯片 Jalapeño(与 Broadcom 合作)
- 2026.3:Sora 视频生成应用停止服务
Anthropic 关键事件
Section titled “Anthropic 关键事件”- 2025.2:发布 Claude 3.7 Sonnet(引入 extended thinking);Claude Code 预览版
- 2025.5.22:发布 Claude Sonnet 4 / Opus 4(Claude 4 代,Opus 4 被列为”Level 3”风险等级)
- 2025.7:Claude Code 营收增长 5.5 倍
- 2025.8:发布 Opus 4.1;Claude for Chrome 浏览器扩展;撤销 OpenAI 的 Claude 访问权限
- 2025.10:发布 Haiku 4.5;Claude Code Web 版 + 沙箱功能
- 2025.11:发布 Opus 4.5(编码/办公大幅提升,引入 Infinite Chats)
- 2026.1:发布 Claude Cowork(桌面 Agent,面向非技术用户)
- 2026.2:发布 Opus 4.6(agent teams 功能);宪法扩展至 23000 字;被国防部列为”供应链风险”
- 2026.3:联邦法官发布临时禁令阻止国防部禁令;Claude Code CLI 源码泄露
- 2026.4:发布 Opus 4.7;Claude Design 视觉创作工具
- 2026.5:发布 Opus 4.8;“Dreaming”Agent 记忆整合功能
- 2026.6:发布 Claude Mythos 5 / Fable 5(网络安全专用);Sonnet 5(100 万 token 上下文);Claude Science 科研模型
- 2026.7:发布 Claude Opus 5(含 3D 渲染能力)
| 术语 | 英文 | 解释 |
|---|---|---|
| 预训练 | Pre-training | 在海量无标注文本上训练语言模型的基础阶段 |
| 监督微调 | Supervised Fine-Tuning, SFT | 用高质量标注数据微调预训练模型 |
| 人类反馈强化学习 | RLHF | 用人类偏好数据训练奖励模型,再用 RL 优化策略 |
| 宪法 AI | Constitutional AI, CAI | Anthropic 的对齐方法,让模型根据原则自我批评和修订 |
| 推理模型 | Reasoning Model | 回答前先进行内部思维链推理的模型,擅长复杂数学/编程/逻辑 |
| 思维链 | Chain-of-Thought, CoT | 让模型逐步展示推理过程的技术,提升复杂问题准确率 |
| 工具调用 | Function Calling / Tool Use | 模型输出结构化函数调用请求,由外部执行 |
| 代码解释器 | Code Interpreter | 模型生成并在沙箱中执行代码的能力 |
| Artifacts | Artifacts | Claude 实时渲染代码产物(UI/SVG/文档)的功能 |
| Computer Use | Computer Use | Claude 操作屏幕截图并输出鼠标键盘指令的能力 |
| 多模态融合 | Multimodal Fusion | 文本、图像、音频等统一在一个模型中处理 |
| MCP | Model Context Protocol | Anthropic 开源的模型-工具连接标准协议 |
| RAG | Retrieval-Augmented Generation | 检索增强生成,先检索知识库再让 LLM 基于检索结果回答 |
| Token | Token | 模型处理文本的最小单位,约 3/4 个英文单词或 1-2 个汉字 |
| 量化 | Quantization | 降低模型参数精度(如 16bit → 4bit)以减少内存和计算开销 |
| 投机解码 | Speculative Decoding | 用小模型快速草拟、大模型验证的推理加速技术 |
| Vibe Coding | Vibe Coding | 凭直觉用自然语言描述需求让 AI 生成应用的非正式编程方式 |
- GPT 系列演进:从 GPT-1(2018,117M 参数)到 GPT-5,模型规模和能力质变的全过程见 语言模型演进。
- Transformer 架构:理解 GPT/Claude 底层结构的前提,见 Transformer 架构 和 注意力机制。
- RLHF 深入:奖励建模、PPO 优化的完整流程见 RLHF 与 LLM 训练 和 安全与对齐。
- 推理优化:KV Cache、投机解码等让大模型在实际产品中可用的技术,见 LLM 推理优化 和 推理优化技术。
- Agent 生态:从工具调用到自主 Agent 的完整图景,见 AI Agent 与多智能体、Agent 模式 和 MCP 协议与工具调用。
- 微调与部署:LoRA(Low-Rank Adaptation,低秩适配——一种只训练少量参数即可微调大模型的技术)等高效微调方法见 PEFT 方法 和 LLM 微调。