模型选择指南
面对上百个大语言模型,如何选出最适合自己场景的那一个?本页提供一套系统化的模型选择方法论——从任务需求、成本、延迟、隐私、部署条件等多维度做决策,并补充 2024-2025 年最新模型格局。它是 LLM 应用生态概览的实战总结篇。前置阅读:LLM 评测与基准。
选模型 = 在能力、成本、速度、隐私四个维度上找到最适合你场景的平衡点。
没有”最好的模型”,只有”最适合你场景的模型”。就像买车——买菜代步选五菱宏光,长途自驾选 SUV,下赛道选跑车。关键问题是:
- 任务有多难?:简单分类 vs 复杂推理 vs 代码生成 vs 多模态理解——不同模型各有擅长。
- 预算多少?:API 按 token(模型处理文本的最小单位)计费,GPT-4o 比 GPT-4o-mini 贵约 17 倍。月调用一百万 token,差距是几美元 vs 几十美元。2025 年的 DeepSeek-V3、Gemini Flash 更将价格压到了行业新低。
- 延迟要求多高?:实时聊天 vs 批量处理,对首 token 延迟(TTFT,从发送请求到收到第一个 token 的时间)和吞吐量(TPS,每秒生成 token 数)的要求天差地别。
- 数据能出本地吗?:金融/医疗/政务等敏感数据可能不允许调外部 API,必须用本地部署的开源模型。
2025 年格局变化:DeepSeek-V3/R1 的横空出世、Claude 3.5 Sonnet 的持续领先、Gemini 2.0 的超长上下文、以及 Llama 3.3 / Qwen 2.5 在开源界的全面发力,使得”闭源 vs 开源”的能力差距大幅缩小,而价格差距缩小得更快。选型的核心理念从”选最强的”转向”选性价比最高的组合”。
闭源 API 模型 vs 开源自部署模型
Section titled “闭源 API 模型 vs 开源自部署模型”这是第一个也是最根本的选择。
闭源 API 模型(GPT-4o、Claude、Gemini 等):
- 优势:性能最强(尤其推理和多模态)、零运维、开箱即用、自动更新。
- 劣势:数据必须发送到供应商服务器、按 token 计费长期成本高、供应商锁定(vendor lock-in,过度依赖单一供应商导致难以迁移的风险)、依赖网络稳定性。
- 适用:绝大多数初创项目、原型验证、对数据隐私无硬性要求的应用。
开源自部署模型(Llama、Qwen、DeepSeek、Mistral 等):
- 优势:数据完全自控、无按量计费(只有硬件成本)、可自由微调、无供应商锁定。
- 劣势:需要 GPU 硬件或云 GPU(成本不低)、运维复杂(推理引擎部署、负载均衡、监控)、性能通常略弱于顶配闭源模型(但差距在快速缩小)。
- 适用:数据隐私敏感(金融/医疗/政务)、超大规模调用(API 费用超过自建成本)、需要深度定制微调。
2025 年开源的突破性进展:DeepSeek-V3 以 671B 参数的 MoE(Mixture of Experts,混合专家模型,每次推理只激活部分参数,兼具大模型能力和小模型速度)架构实现了逼近 GPT-4o 的性能,而 API 价格仅为 GPT-4o 的 1/10。DeepSeek-R1 更是以纯强化学习训练达到了 o1 级别的推理能力,且完全开源。这意味着”开源模型能力不够”不再是默认假设——在你的具体任务上,开源模型可能已经够用甚至更优。
模型规模与能力-成本权衡
Section titled “模型规模与能力-成本权衡”对于同系列的模型,参数规模(parameter count,模型中可学习权重变量的总数)越大能力越强,但成本和延迟也越高。以常见规模分档:
- 小模型(1B-8B):Qwen2.5-7B、Llama-3.1-8B、Gemma-2-9B、Phi-4(14B 但效率极高)等。速度快、成本低,适合简单分类、提取、路由、轻量对话。自部署时可在单张消费级 GPU(如 RTX 4090)上运行,推理速度可达 100+ tokens/s。
- 中型模型(8B-70B):Llama-3.3-70B、Qwen2.5-72B、DeepSeek-V3(671B MoE,每次只激活 37B)等。能力与 GPT-4 有差距但显著缩小,适合中复杂度推理和生成。自部署需要多 GPU(如 2-4 张 A100)。
- 大模型(70B+):GPT-4o、Claude 3.5 Sonnet、Gemini 2.0 Pro(闭源),Llama-3.1-405B、DeepSeek-V3(开源)等。推理能力最强,适合复杂代码、数学、多步推理、Agent 场景。
实际选择建议:先用小模型跑通流程,能力不够再升级。 大多数应用场景中,70B 级别模型(或等量的 MoE 模型)的性价比最高。
MoE 模型的特殊考量:DeepSeek-V3、Mixtral 等 MoE 模型的总参数量很大(如 671B),但每次推理只激活一小部分(如 37B)。这意味着:(1) 推理速度接近 37B 的稠密模型;(2) 显存需求仍然要装下全部 671B 参数(除非用 offloading 技术);(3) API 价格按激活参数计算,远低于等性能的稠密模型。
任务匹配:不同模型各有所长
Section titled “任务匹配:不同模型各有所长”不同模型在不同任务上的表现差异很大,不能只看综合排行榜分数:
- 代码生成:Claude 3.5 Sonnet 被广泛认为是 2025 年初最佳代码模型;DeepSeek-Coder-V2、GPT-4o 紧随其后。开源方面,DeepSeek-V3、Qwen2.5-Coder 在自部署场景有优势。详见 AI 编程助手。
- 中文理解:Qwen 系列、DeepSeek、GLM 等中文优化模型在中文任务上显著优于纯英文模型。这不仅体现在语义理解上,还体现在 token 效率上——中文在 Qwen 的 tokenizer(分词器)中可能 1 个汉字 = 1 个 token,而 GPT-4o 可能需要 2-3 个 token 编码同一个汉字,直接影响成本。详见Tokenizer 分词器详解。
- 多模态(同时处理文本、图像、音频等多种数据类型的能力):GPT-4o、Gemini 2.0、Claude 3.5 Sonnet 支持图像输入。如果需要图文理解,必须选多模态模型。详见多模态 LLM。
- 长上下文(模型单次能处理的最大文本长度):Gemini 2.0(1M-2M token)、Claude 3.5(200K)、GPT-4o(128K)支持超长上下文。需要处理长文档时优先考虑。但注意”支持”不等于”用好”——lost-in-the-middle 现象意味着超长上下文中部的信息容易被忽略。详见上下文工程。
- 推理与数学:OpenAI o1/o3 系列、DeepSeek-R1 等推理增强模型(reasoning model,在回答前先做内部”思维链”推理的模型)在复杂数学和逻辑推理上远超通用模型。Agent 和工具调用场景也表现更好。这些模型的首 token 延迟较高(因为要先”想”很久),不适合实时聊天。
2024-2025 年主流模型速览
Section titled “2024-2025 年主流模型速览”以下按闭源和开源分类,列出撰写本文时(2025 年初)的主要模型及其定位:
闭源模型:
| 模型 | 定位 | 上下文窗口 | 核心优势 |
|---|---|---|---|
| GPT-4o | 通用旗舰 | 128K | 全模态(文本+图像+音频),均衡全面 |
| o1 / o3 | 推理特化 | 200K | 复杂数学/代码/科学推理,内部思维链 |
| Claude 3.5 Sonnet | 代码与分析 | 200K | 代码生成最佳,长文档分析,计算机使用能力 |
| Claude 3.5 Haiku | 轻量高效 | 200K | 速度快、价格低,能力不输早期 GPT-4 |
| Gemini 2.0 Pro | 超长上下文 | 1M-2M | 最长上下文窗口,原生多模态,Flash 系列极具性价比 |
| Gemini 2.0 Flash | 性价比 | 1M | 极低延迟和价格,适合高并发场景 |
开源模型:
| 模型 | 参数规模 | 架构 | 核心优势 |
|---|---|---|---|
| DeepSeek-V3 | 671B (MoE, 激活 37B) | MoE | 接近 GPT-4o 性能,API 价格极低,训练成本仅 $5.6M |
| DeepSeek-R1 | 671B (MoE) | MoE + RL | o1 级推理能力,完全开源(含训练方法),可蒸馏为小模型 |
| Qwen2.5-72B | 72B | 稠密 | 中文最佳开源模型,全面均衡,工具调用能力强 |
| Qwen2.5-Coder-32B | 32B | 稠密 | 代码专用,接近 GPT-4 级别的编程能力 |
| Llama 3.3-70B | 70B | 稠密 | Meta 旗舰,英文任务强,生态最成熟 |
| Mistral Large 2 | 123B | 稠密 | 欧洲队代表,多语言能力强 |
| Phi-4 | 14B | 稠密 | 微软出品,小体积大能力,适合边缘部署 |
⚠️ 以上信息基于 2025 年初的公开资料,模型迭代极快(通常每 3-6 个月就有新一代发布),请以各供应商官方页面为准。
成本估算框架
Section titled “成本估算框架”API 模型的成本 = 输入 token 数 × 输入单价 + 输出 token 数 × 输出单价。注意输出通常比输入贵 3-5 倍(因为生成比理解更耗算力)。
估算步骤:
- 估算单次请求的输入 token(系统提示词 + 用户输入 + 检索内容 + 历史对话)。
- 估算单次请求的输出 token(通常 200-1000)。
- 乘以预计日调用量,再乘以 30 得月费用。
- 对比不同模型的价格差异——通常用便宜模型处理简单请求、贵模型处理复杂请求的混合策略最省钱。
Prompt Caching 的省钱效果:2024-2025 年,OpenAI、Anthropic、Google 都推出了 prompt caching(提示词缓存)功能——如果多次请求的 system prompt 或前缀相同,供应商会缓存其处理结果,后续请求的输入价格降低 50%-90%。对于 RAG 系统(system prompt + 检索内容往往重复)和长对话(历史消息重复发送),prompt caching 能显著降本。
自部署模型的成本 = GPU 小时费(或折旧)+ 运维人力。当月 API 费用超过自部署成本时,迁到自部署更划算。粗略估算:一张 A100 80GB 的月成本约 $2000-4000(云租赁),如果月 API 费用超过这个数,自部署 70B 级别模型在经济上就划算了。
延迟与吞吐量考量
Section titled “延迟与吞吐量考量”- 首 token 延迟(TTFT, Time To First Token):从发送请求到收到第一个 token 的时间。实时聊天场景(如客服机器人)对此敏感,应选小模型或使用流式输出(streaming,逐 token 返回而非等全部生成完再返回)。推理模型(o1/o3)的 TTFT 可能高达 10-60 秒(因为要先做内部思维链),不适合实时场景。
- 吞吐量(TPS, Tokens Per Second):每秒生成 token 数。批量处理场景(如文档摘要)对吞吐量敏感。Gemini 2.0 Flash 和 Claude 3.5 Haiku 的吞吐量可达 100+ TPS。
- 并发能力:API 有速率限制(RPM = 每分钟请求数,TPM = 每分钟 token 数),自部署受限于 GPU 数量和显存。使用 vLLM 等推理引擎的连续批处理(continuous batching)技术可以大幅提升自部署的并发吞吐。
如果需要模型深度适配特定领域(医疗、法律、内部知识体系等),微调(fine-tuning,用领域数据进一步训练模型权重以适配特定任务)能力是选型的重要维度:
- 开源模型可以自由微调。详见LLM 微调技术。
- 闭源 API 模型中,OpenAI 支持有限的自定义微调(需付费且有最低数据量要求),Claude/Gemini 目前不支持微调。
- 2025 年的替代方案:即使不能微调闭源模型,也可以用”蒸馏微调”策略——用 GPT-4o/Claude 生成大量高质量领域问答数据,然后微调一个开源小模型来模仿其输出。这比直接微调闭源模型更可控且成本更低。
推理模型 vs 通用模型:2025 年的新选择
Section titled “推理模型 vs 通用模型:2025 年的新选择”2024-2025 年最重要的模型分化趋势之一是”推理模型”的兴起:
| 维度 | 通用模型(GPT-4o, Claude 3.5, Gemini) | 推理模型(o1/o3, DeepSeek-R1) |
|---|---|---|
| 思考方式 | 直接生成答案 | 先内部”思考”(思维链),再生成答案 |
| 适用场景 | 日常对话、写作、简单代码、多模态 | 复杂数学、科学推理、竞赛编程、多步逻辑 |
| 延迟 | 快(TTFT 通常 < 1s) | 慢(TTFT 可能 10-60s,因为要先”想”) |
| 成本 | 标准 | 更高(思维链消耗大量输出 token) |
| 工具调用 | 好 | 较弱(部分推理模型不支持 function calling) |
选择建议:不要默认用推理模型。只在真正需要复杂推理(数学证明、算法设计、多步逻辑分析)时才用推理模型;日常任务用通用模型更快更便宜。一个常见的混合策略是:通用模型做路由判断,复杂推理任务才转发给推理模型。
模型选择决策树
Section titled “模型选择决策树”四维评估框架
Section titled “四维评估框架”推理模型 vs 通用模型的适用范围
Section titled “推理模型 vs 通用模型的适用范围”用 API 成本估算工具做预算
Section titled “用 API 成本估算工具做预算”# 模型价格参考(2025年初,美元/百万token,以官方公布为准)MODEL_PRICING = { # 闭源旗舰 "gpt-4o": {"input": 2.50, "output": 10.00}, "gpt-4o-mini": {"input": 0.15, "output": 0.60}, "claude-3.5-sonnet": {"input": 3.00, "output": 15.00}, "claude-3.5-haiku": {"input": 0.80, "output": 4.00}, "gemini-2.0-flash": {"input": 0.10, "output": 0.40}, # 开源 API "deepseek-v3": {"input": 0.27, "output": 1.10}, "deepseek-r1": {"input": 0.55, "output": 2.19},}
def estimate_monthly_cost(model, input_tokens, output_tokens, daily_calls): """估算月度 API 费用""" p = MODEL_PRICING[model] daily_cost = ( input_tokens * p["input"] / 1_000_000 + output_tokens * p["output"] / 1_000_000 ) * daily_calls monthly = daily_cost * 30 return monthly
# 场景: RAG 聊天机器人,每天 1000 次调用# 每次输入约 2000 token(含检索内容),输出约 500 tokenfor model in ["gpt-4o", "gpt-4o-mini", "claude-3.5-sonnet", "gemini-2.0-flash", "deepseek-v3"]: cost = estimate_monthly_cost(model, 2000, 500, 1000) print(f"{model:25s}: ${cost:.2f}/月")# gpt-4o : $300.00/月# gpt-4o-mini : $24.00/月# claude-3.5-sonnet : $525.00/月# gemini-2.0-flash : $21.00/月# deepseek-v3 : $53.10/月## 结论:gemini-2.0-flash 和 gpt-4o-mini 是性价比之王;# deepseek-v3 以开源价格提供接近旗舰的能力。用 LLM 做智能路由(Model Routing)
Section titled “用 LLM 做智能路由(Model Routing)”模型路由(Model Routing,根据请求复杂度自动选择不同规模模型以优化成本)是最有效的省钱策略:
import openai
client = openai.OpenAI()
def route_and_answer(question): """根据问题复杂度自动选择模型""" # 第一步: 用小模型判断问题复杂度 resp = client.chat.completions.create( model="gpt-4o-mini", messages=[{ "role": "user", "content": ( "判断以下问题的复杂度。只输出一个词:\n" "- simple(简单事实/闲聊/格式转换)\n" "- complex(需要推理/代码/数学/长文生成)\n\n" f"问题: {question}" ), }], max_tokens=5, ) complexity = resp.choices[0].message.content.strip().lower()
# 第二步: 简单问题用便宜模型,复杂问题用强模型 model = "gpt-4o-mini" if "simple" in complexity else "gpt-4o" print(f"路由到: {model}")
answer = client.chat.completions.create( model=model, messages=[{"role": "user", "content": question}], max_tokens=500, ) return answer.choices[0].message.content
# 简单问题 → gpt-4o-mini(省钱)print(route_and_answer("北京是哪个国家的首都?"))# 复杂问题 → gpt-4o(保质量)print(route_and_answer("请用 Rust 实现一个线程安全的 LRU 缓存"))用 LiteLLM 统一接口做多模型 A/B 测试
Section titled “用 LiteLLM 统一接口做多模型 A/B 测试”"""LiteLLM 提供统一的 OpenAI 兼容接口,可以一行代码切换底层模型。适合做多模型对比测试或实现主备模型切换。"""# pip install litellmfrom litellm import completionimport os
# 同一个函数,只需改 model 参数即可切换底层供应商models_to_test = [ "gpt-4o", # OpenAI "claude-3-5-sonnet-20241022", # Anthropic "gemini/gemini-2.0-flash", # Google "deepseek/deepseek-chat", # DeepSeek]
question = "请解释什么是向量数据库,以及它在 AI 应用中的作用。"
for model in models_to_test: try: resp = completion( model=model, messages=[{"role": "user", "content": question}], max_tokens=300, api_key=os.environ.get("OPENAI_API_KEY"), # 各供应商 key 通过环境变量设置 ) answer = resp.choices[0].message.content cost = resp._hidden_params.get("response_cost", "?") print(f"\n{'='*60}") print(f"模型: {model} | 估算费用: ${cost}") print(f"回答: {answer[:200]}...") except Exception as e: print(f"{model}: 调用失败 - {e}")- 先用 API 验证再考虑自部署:先用闭源 API 快速跑通产品和验证需求,等调用规模大了或有隐私合规需求时再迁到开源模型。过早自部署是过度工程。
- 混合路由省钱:90% 的请求是简单的,用便宜模型处理;10% 复杂请求才用贵模型。上面的 Model Routing 代码可以省 70% 以上的 API 费用。2025 年,DeepSeek-V3 和 Gemini Flash 的价格已经低到”几乎不需要路由”的程度,但对于大批量处理场景仍然值得。
- 不要只看排行榜:LMSYS Chatbot Arena 等排行榜是综合分数,和你的具体任务可能不相关。一定要在自己的业务数据上做评测(详见 LLM 评测与基准),用 A/B 测试验证实际效果。建议构建一个 50-100 条的领域评测集,每次换模型时跑一遍。
- 关注模型的上下文窗口:不要因为”支持 128K”就觉得真的能用好 128K。实际有效利用长度可能远小于标注值——“lost in the middle”现象表明,放在上下文中部的信息容易被忽略。详见上下文工程。
- 考虑生态和工具链:模型选择不只是模型本身,还包括 SDK 成熟度、社区生态、调试工具、微调支持等。OpenAI/Anthropic 的生态最成熟,新项目首选。但如果团队有较强的工程能力,DeepSeek/Qwen + vLLM 的自建方案可以节省大量成本。
- 设置备份模型:单一供应商有宕机和限流风险(2024 年 OpenAI、Anthropic 都发生过数小时级宕机)。生产系统应配置主备模型,主模型不可用时自动降级到备用模型。LiteLLM、OpenRouter 等工具支持自动回退(fallback)。
- 善用 prompt caching:如果你的请求有大量重复前缀(system prompt、RAG 检索结果、长对话历史),务必启用 prompt caching。OpenAI 和 Anthropic 的缓存命中可降低 50%-90% 的输入 token 费用。
- 推理模型不要滥用:o1/o3/R1 等推理模型虽然推理能力更强,但延迟高、成本高(思维链 token 也计费),且部分不支持 function calling 和多模态。只在真正需要复杂推理时使用。
- 关注 tokenizer 效率:同样的中文文本,不同模型的 token 数可能差 2-3 倍,直接影响成本和速度。中文为主的场景优先考虑 Qwen、DeepSeek 等中文友好的模型。详见Tokenizer 分词器详解。
- 通用聊天机器人 / 客服:Gemini 2.0 Flash 或 GPT-4o-mini 性价比最高,能力足够应对绝大多数客服场景。月费可控制在 $20-30 级别(1000 次/天调用量)。
- AI 编程助手:Claude 3.5 Sonnet 是 2025 年初公认的最佳代码模型,GPT-4o 紧随其后。自部署场景可用 DeepSeek-V3 或 Qwen2.5-Coder。详见 AI 编程助手。
- RAG 问答系统:检索用便宜模型做查询改写,生成用中等模型做答案合成。DeepSeek-V3 在 RAG 场景的性价比极高。详见 RAG 检索增强生成。
- 企业私有部署:金融/医疗/政务等场景,用 Qwen2.5-72B 或 DeepSeek-V3 等开源模型自部署。详见LLM 推理优化。
- AI Agent / 复杂推理:o1/o3 系列或 Claude 3.5 Sonnet 的推理能力最强,适合多步规划和工具调用。DeepSeek-R1 是开源推理模型的首选。详见 AI Agent。
- 超长文档处理:Gemini 2.0(1M-2M token)是唯一能单次处理整本书或大型代码库的模型。其他模型需要分段处理 + RAG。
典型类库与工具
Section titled “典型类库与工具”| 工具 / 服务 | 类型 | 说明 |
|---|---|---|
| LMSYS Chatbot Arena | 评测平台 | 众包盲测排行榜,反映模型的真实人类偏好排名,选型必备参考 |
| OpenRouter | API 聚合 | 统一 API 接口访问 200+ 模型,支持自动回退和成本控制,适合多模型策略 |
| LiteLLM | Python 库 | 统一 OpenAI/Anthropic/Google/DeepSeek 等 100+ 模型的 SDK 接口,简化模型切换 |
| Artificial Analysis | 评测网站 | 提供模型性能-成本-延迟的三维对比图表,选型决策利器 |
| vLLM | 推理引擎 | 开源模型高性能推理框架,自部署首选,详见 LLM 推理优化 |
| HuggingFace Open LLM Leaderboard | 评测平台 | 开源模型的标准化评测排行榜,开源选型必备 |
| Ollama | 本地推理 | 一键在本地运行开源模型(Llama、Qwen、DeepSeek 等),适合开发测试 |
| SGLang | 推理引擎 | 新一代高性能推理引擎,支持 RadixAttention 加速重复前缀处理 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 闭源模型 | Closed-source Model | 仅通过 API 提供服务、权重不公开的模型(如 GPT-4o、Claude) |
| 开源模型 | Open-source Model | 权重公开、可自部署的模型(如 Llama、Qwen、DeepSeek) |
| 混合专家模型 | MoE, Mixture of Experts | 每次推理只激活部分参数的架构,兼具大模型能力和小模型速度 |
| 推理模型 | Reasoning Model | 在回答前先做内部思维链推理的模型(如 o1、DeepSeek-R1),擅长复杂逻辑但延迟较高 |
| 模型路由 | Model Routing | 根据请求复杂度自动选择不同规模模型以优化成本 |
| 首 token 延迟 | TTFT, Time To First Token | 从发送请求到收到第一个 token 的时间,影响用户体验 |
| 吞吐量 | TPS, Tokens Per Second | 每秒生成的 token 数,衡量模型的生成速度 |
| 速率限制 | Rate Limit | API 供应商对每分钟请求数和 token 数的限制 |
| 供应商锁定 | Vendor Lock-in | 过度依赖单一供应商导致难以迁移的风险 |
| 混合部署 | Hybrid Deployment | 同时使用 API 和自部署模型的策略,取长补短 |
| 提示词缓存 | Prompt Caching | 缓存重复前缀的处理结果,降低后续请求的输入 token 费用 |
| 连续批处理 | Continuous Batching | 推理引擎技术,动态将多个请求合并处理以提升 GPU 利用率 |
| 蒸馏 | Distillation | 用大模型的输出训练小模型,使小模型获得接近大模型的能力 |
- LMSYS Chatbot Arena 官网(chatbotarena.ai):最权威的 LLM 人类偏好排行榜,使用 Elo 评分系统(国际象棋中用于衡量选手相对水平的评分方法),是闭源模型选型的首选参考。
- HuggingFace Open LLM Leaderboard:开源模型的标准化评测排行榜,使用统一的评测套件,选开源模型必看。
- Artificial Analysis 官网(artificialanalysis.ai):提供模型能力-成本-延迟的三维对比可视化,非常适合做选型决策。
- DeepSeek-V3 / R1 技术报告:DeepSeek AI 发布的开源技术报告,详细披露了 MoE 架构设计和强化学习训练方法,是理解 2025 年开源前沿的重要参考。
- OpenAI / Anthropic / Google / DeepSeek 官方定价页面:各供应商官方 API 定价,选型时务必查阅最新价格(变化频繁)。
- vLLM 官方文档:开源模型高性能推理部署的首选框架文档,详见 LLM 推理优化。