Skip to content

LLM 应用生态概览

本页介绍大语言模型(LLM)从”裸模型”到”可用产品”之间完整的应用生态:光有 LLM 这个”引擎”还不够,还需要 RAG(记忆)、Agent(手脚)、Tool Use(工具)、Prompt(驾驶技巧)等配套技术才能跑起来。它是生成式 AI 与 LLM 领域的应用层总览,相关核心技术分别展开于提示工程、RAG 检索增强生成、AI Agent 与多智能体、MCP 协议与工具调用、向量数据库与LLM 微调技术。

  • LLM 应用生态概览:本页——LLM 从”裸模型”到”可用产品”的应用层全景
  • 提示工程:通过精心设计 Prompt 引导 LLM 产生更好的输出,最基础也最实用的技术
  • RAG 检索增强生成:先从外部知识库检索相关文档再生成答案,解决 LLM 知识滞后问题
  • AI Agent 与多智能体:让 LLM 从”你问我答”进化为”自己规划、自己执行”的高阶形态
  • MCP 协议与工具调用:Function Calling 与 MCP 标准,让 LLM 能调用外部函数/API
  • 向量数据库:专门存储和检索高维向量的数据库,RAG 与语义搜索的底层存储
  • LLM 微调技术:用领域数据继续训练,让通用模型变身领域专家
  • LLM 推理优化:让数十亿参数的模型跑得更快、更省、更稳的部署技术
  • 嵌入模型:把文字/图像转换为向量,是 RAG 与语义搜索的基础引擎
  • 重排序模型:RAG 流程中的”二轮审查”,用 Cross-Encoder 对候选精排选出最相关结果
  • LLM 评测与基准:从知识、推理、代码到人类盲测的主流评测基准与自动评测方法
  • AI 安全与护栏:输入/输出护栏、对齐技术与红队测试,企业级 AI 上线的安全层
  • 推理模型 o1 与 R1:以 o1/o3、DeepSeek-R1 为代表,让模型回答前进行长时间”内部思考”
  • 多模态 LLM:能同时理解文本、图像、音频、视频的 LLM,如 GPT-4o、Gemini
  • 小模型与端侧部署:通过量化、蒸馏、剪枝让 LLM 跑在手机和边缘设备上
  • 结构化输出:让 LLM 输出符合 JSON/Schema 的结果,从聊天工具变成系统组件
  • 流式输出与 SSE:让文本逐字实时返回,ChatGPT、Cursor 流畅体验的技术基石
  • Tokenizer 分词器详解:从字符级到 BPE/WordPiece/Unigram 的主流分词算法谱系
  • 上下文工程:提示工程的高阶延伸,系统性设计和管理 LLM 上下文窗口
  • AI 编程助手:从 Tab 补全到 Agent 自主编程,LLM 最成功的商业落地之一
  • AI 搜索引擎:将”给链接”升级为”给答案”的 toC 高频应用,完整技术链路
  • 模型选择指南:按任务、成本、延迟、隐私等多维度系统化选型的方法论

LLM 是引擎,应用生态是车身和方向盘。 光有引擎跑不起来——你还需要:

  • Prompt(驾驶技巧):同样的车,老司机开得又快又稳。提示工程就是”怎么跟 AI 说话”的方法论。2025 年这一领域已进化为上下文工程(Context Engineering)——不只是写好单条 Prompt,而是系统性管理送入模型上下文窗口的全部信息(系统指令、对话历史、检索文档、工具调用结果等),以在有限 token 预算内最大化回答质量。
  • RAG(记忆/导航):LLM 的知识停在训练截止日,RAG 让它先”翻书”再答题。详见 RAG 检索增强生成。2025 年 RAG 的趋势是从简单的”检索 → 生成”走向 Agentic RAG(智能体化 RAG)——模型自主决定是否需要检索、检索几次、如何判断结果质量,并支持多轮迭代检索。
  • Agent(手脚):让 LLM 不只是”你问我答”,而是自己规划、自己执行。详见 AI Agent 与多智能体。2025 年最大的变化是 Computer Use(计算机操控)能力——以 Claude Computer Use、OpenAI Operator 为代表,LLM 可以直接操作浏览器、点击按钮、填写表单,真正像人类一样使用软件。
  • Tool Use(工具箱):给 LLM 接 API、查数据库、调函数。详见 MCP 协议与工具调用。2024 年底 Anthropic 发布的 MCP(Model Context Protocol,模型上下文协议) 被称为”AI 的 USB-C 接口”——一个统一协议让任意模型连接任意工具,2025 年已被 OpenAI、Google、主流 IDE 和开源社区广泛采纳。
  • 向量数据库(图书馆):RAG 和语义搜索的底层存储。详见 向量数据库。
  • 微调(专业培训):让通用模型变身领域专家。详见 LLM 微调技术。

2025 年生态新趋势:推理模型(o1/o3、DeepSeek-R1)让模型在回答前”深度思考”数十秒甚至几分钟,显著提升了数学、编程和复杂推理能力;百万级上下文窗口(Gemini 2.0 的 2M tokens)让”整本书塞进去”成为现实;开源模型(DeepSeek-V3、Qwen2.5、Llama 3.3)性能快速逼近闭源旗舰,成本持续下降。

LLM 核心位于中央,周围环绕着六大应用生态技术层:

这六大方向不是独立的——真实产品通常同时用多种技术:比如 Perplexity = RAG + Prompt;Cursor = Agent + Tool Use + RAG;企业 AI 助手 = RAG + 微调 + Agent。

从底层硬件到顶层产品,整个 LLM 应用栈可以清晰地分为多层。理解这个分层有助于你定位自己需要学习或构建的技术位于哪一层:

  • 硬件层:GPU(NVIDIA H100/B200)、TPU(Google)、NPU(端侧芯片)提供算力。
  • 推理引擎层:负责模型的高效加载、批处理与加速。vLLM 通过 PagedAttention(分页注意力,一种对 KV Cache 做虚拟内存式管理的技术)大幅提升吞吐;SGLang 通过 RadixAttention(基数树注意力,一种缓存历史前缀的机制)加速多轮对话与结构化输出。
  • 模型层:LLM 本身,可能通过 API 调用(闭源)或自部署(开源)。详见预训练架构。
  • 编排层:把 Prompt、RAG、Agent、Tool 等组件串成完整工作流。LangChain(通用编排)、LlamaIndex(RAG 专精)、DSPy(声明式 Prompt 优化)是主流选择。
  • 应用层:面向终端用户的产品。
from openai import OpenAI
client = OpenAI() # 默认读取环境变量 OPENAI_API_KEY
# system prompt 设定 AI 角色,user 是用户输入
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "你是一个友好的 AI 助手,用简洁中文回答。"},
{"role": "user", "content": "用一句话解释什么是 RAG。"},
],
temperature=0.7, # 0 严谨确定,1 更有创意
)
print(response.choices[0].message.content)

把 openai 换成 anthropic SDK,把 chat.completions.create 换成 messages.create,逻辑完全一致——两大厂商 API 设计高度相似。实际上,2025 年越来越多的模型提供商(DeepSeek、Qwen、Groq 等)都兼容 OpenAI SDK 的接口格式,切换模型只需改一行 base_url 和 api_key。

Tool Use 是 LLM 从”聊天”走向”干活”的关键能力。以下示例展示模型如何自主决定调用哪个函数:

import json
tools = [{
"type": "function",
"function": {
"name": "get_weather",
"description": "查询指定城市的当前天气",
"parameters": {
"type": "object",
"properties": {
"city": {"type": "string", "description": "城市名,如'北京'"}
},
"required": ["city"]
}
}
}]
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": "北京今天天气怎么样?"}],
tools=tools, # 把可用工具的 Schema 传给模型
)
# 模型不会直接回答,而是返回一个 function_call,要求我们执行 get_weather
tool_call = response.choices[0].message.tool_calls[0]
args = json.loads(tool_call.function.arguments) # {"city": "北京"}
print(f"模型要求调用: {tool_call.function.name}({args})")
# → 接下来你执行真正的查询函数,把结果拼回 messages 再发给模型,它就能给出最终回答

这段代码演示了 Function Calling(函数调用)的核心流程:模型不执行代码,而是输出结构化的”调用请求”(JSON 格式的函数名和参数),由你的程序实际执行后把结果返回给模型。这个”请求 → 执行 → 回传”的循环就是 Agent 的基础循环(Agent Loop)。详见MCP 协议与工具调用。

  • ChatGPT:OpenAI 的对话产品,LLM + 对话管理 + 工具调用(搜索、代码执行、图像生成),全球用户过亿,是 LLM 应用生态最完整的标杆。2025 年进一步集成了 GPT Store、自定义 GPTs、Canvas(协作编辑)、以及基于 o3 的深度推理模式。
  • GitHub Copilot:代码补全与生成,LLM + 代码上下文 + 编辑器集成,开发者最爱用的 AI 编程助手之一。
  • Perplexity:AI 搜索引擎,LLM + RAG + 实时网页检索,每次回答都附引用来源——“开卷考试”的典范。
  • Cursor / Windsurf:AI 原生代码编辑器。不只是补全代码,而是能理解整个项目结构、自主修改多个文件、运行测试、修复报错——代表了 Agentic Coding(智能体编程)的前沿。2025 年这类工具已被数百万开发者日常使用。
  • 企业 AI 助手:内部知识库问答,LLM + 私有数据 RAG + 权限管控,让员工用自然语言查询公司文档、合同、流程。
  • Devin / Claude Code / Kimi Code:自主编程 Agent。给定一个高级需求(如”帮我写一个 REST API 并部署”),Agent 自己规划步骤、写代码、调试、运行命令、完成部署。这是 2025 年 Agentic AI 最具突破性的应用方向之一。

由于联网搜索配额用尽,以下内容基于截至 2025 年中的公开信息整理。

1. Agentic AI(智能体化)成为核心范式

Section titled “1. Agentic AI(智能体化)成为核心范式”

2025 年最大的行业共识是:LLM 应用正从”你问我答”的 Chatbot 模式,全面转向”你给目标、我来搞定”的 Agent 模式。这意味着:

  • 自主规划:Agent 将复杂目标分解为子步骤,逐步执行。
  • 工具使用:Agent 自主选择并调用工具(搜索、代码执行、数据库查询、API 调用)。
  • 多轮反思:Agent 检查自己的输出,发现错误后自我修正(Self-Correction)。
  • 多智能体协作:多个专职 Agent 分工合作——如一个负责研究、一个负责写作、一个负责审查。详见AI Agent 与多智能体。

2. 推理模型(Reasoning Models)开辟新路线

Section titled “2. 推理模型(Reasoning Models)开辟新路线”

OpenAI o1(2024 年 9 月)开创、DeepSeek-R1(2025 年 1 月)开源推广的推理模型,让模型在输出最终答案前先生成一段长链式推理(Chain-of-Thought)。这让模型在数学竞赛(AIME)、编程(Codeforces)和科学推理上的表现产生质的飞跃。关键影响:

  • R1 完全开源(包括训练方法),证明了推理能力可以通过 RL(强化学习)以极低成本获得——R1 的训练成本据称不到 600 万美元,远低于传统大模型的训练预算。
  • 开源社区迅速跟进,涌现出大量 R1 蒸馏模型(在 Qwen、Llama 基座上蒸馏推理能力)。
  • 行业开始区分 System 1(快思考,即时回答) 和 System 2(慢思考,深度推理) 两种模式,根据任务复杂度动态选择。详见推理模型 o1 与 R1。

2025 年开源与闭源的差距大幅缩小:

  • DeepSeek-V3(671B 参数 MoE 架构,仅激活 37B)在多个基准上媲美 GPT-4o,训练成本仅约 557 万美元。
  • Qwen2.5 / Qwen3 阿里通义千问系列覆盖 0.5B 到 72B,在中文和多语言任务上表现优异。
  • Llama 3.3 / Llama 4 Meta 持续推进开源前沿。
  • 开源模型的存在让自部署成为可行选择,尤其对数据隐私敏感的企业和成本敏感的开发者。

2023 年 GPT-4 的价格是 60/1Moutputtokens;到2025年中,同等甚至更强能力的模型(GPT−4o、Claude3.5Sonnet、DeepSeek−V3)价格已降到60/1M output tokens;到 2025 年中,同等甚至更强能力的模型(GPT-4o、Claude 3.5 Sonnet、DeepSeek-V3)价格已降到 2-15/1M output tokens——降幅超过 90%。这主要得益于:

  • 模型架构优化(MoE、GQA、KV Cache 压缩)。
  • 推理引擎进步(vLLM PagedAttention、连续批处理 Continuous Batching、投机解码 Speculative Decoding)。详见LLM 推理优化。
  • 硬件升级(H100/B200)与量化技术(INT8/INT4 推理)。

5. MCP 协议成为工具调用的事实标准

Section titled “5. MCP 协议成为工具调用的事实标准”

Anthropic 于 2024 年 11 月开源的 MCP(Model Context Protocol) 在 2025 年迅速普及。它的价值在于:

  • 统一接口:以前每对接一个新工具(数据库、API、文件系统),都要为不同模型写不同的适配代码;MCP 提供了一套标准协议,“一次开发,所有模型通用”。
  • 生态效应:OpenAI、Google、Microsoft、Block 等相继宣布支持 MCP;大量 MCP Server(工具适配器)在开源社区涌现。
  • 详见MCP 协议与工具调用。
  • Gemini 1.5 Pro 率先实现 2M tokens(约 150 万汉字)的上下文窗口。
  • Claude 3.5 支持 200K tokens。
  • 长上下文改变了应用设计:以前需要 RAG 切分检索的场景,现在可能直接”全塞进去”;但长上下文的”中间遗忘”(Lost in the Middle,指模型对位于上下文中间位置的信息关注度下降的现象)仍是挑战。
类库语言说明
OpenAI SDKPython / TS调用 GPT 系列模型的官方 SDK,API 最简洁;2025 年已成为事实上的行业标准接口
Anthropic SDKPython / TS调用 Claude 系列模型的官方 SDK,擅长长上下文与推理
LangChainPython / TSLLM 应用编排框架,串联 Prompt、RAG、Agent、工具;2025 年推出 LangGraph 用于构建有状态的多步 Agent
LlamaIndexPython专注数据连接与 RAG 的框架,文档索引能力突出
vLLMPython高吞吐开源推理引擎,PagedAttention + 连续批处理,自部署首选
DSPyPython声明式 LLM 程序框架,自动优化 Prompt 而非手工编写
术语英文解释
大语言模型LLM (Large Language Model)基于海量文本训练的大规模语言模型,如 GPT、Claude、Llama
词元TokenLLM 处理文本的最小单位,约 ¾ 个英文单词或 1-2 个汉字
上下文窗口Context Window模型一次能处理的最大 token 数,决定能”记住”多少对话/文档
系统提示词System Prompt对话开头设定 AI 角色和行为的指令,用户通常不可见
应用程序接口API通过 HTTP 请求调用 LLM 的标准接口,按 token 计费
温度Temperature控制输出随机性的参数,0 = 最确定,1 = 更有创意
函数调用Function Calling模型输出结构化 JSON 请求让程序执行外部函数的能力
模型上下文协议MCP (Model Context Protocol)Anthropic 提出的统一工具连接协议,让模型标准化地访问外部数据源和工具
强化学习RL (Reinforcement Learning)通过试错和奖励信号学习策略的机器学习范式,是推理模型训练的核心技术
混合专家模型MoE (Mixture of Experts)每次推理只激活部分专家子网络的稀疏架构,大幅降低计算成本
  • GPT-3:Brown et al., “Language Models are Few-Shot Learners”(2020),证明了”大模型 + 少样本 Prompt”的威力,掀起大模型浪潮。
  • InstructGPT:Ouyang et al., “Training language models to follow instructions with human feedback”(2022),RLHF 对齐的里程碑,GPT-3.5/4 的直接前身。
  • ChatGPT:OpenAI 2022 年底发布,两个月用户破亿,LLM 应用生态的引爆点。语言模型演进详见语言模型演进史。
  • DeepSeek-R1 技术报告(2025):展示了纯 RL(无需 SFT 冷启动的上半场)即可让模型自发涌现长链推理,并以极低成本开源复现 o1 级能力。
  • Anthropic MCP 规范(2024-2025):模型上下文协议的官方规范文档,定义了工具/资源/提示三大原语。