Skip to content

模型选择指南

面对上百个大语言模型,如何选出最适合自己场景的那一个?本页提供一套系统化的模型选择方法论——从任务需求、成本、延迟、隐私、部署条件等多维度做决策,并补充 2024-2025 年最新模型格局。它是 LLM 应用生态概览的实战总结篇。前置阅读:LLM 评测与基准。

选模型 = 在能力、成本、速度、隐私四个维度上找到最适合你场景的平衡点。

没有”最好的模型”,只有”最适合你场景的模型”。就像买车——买菜代步选五菱宏光,长途自驾选 SUV,下赛道选跑车。关键问题是:

  • 任务有多难?:简单分类 vs 复杂推理 vs 代码生成 vs 多模态理解——不同模型各有擅长。
  • 预算多少?:API 按 token(模型处理文本的最小单位)计费,GPT-4o 比 GPT-4o-mini 贵约 17 倍。月调用一百万 token,差距是几美元 vs 几十美元。2025 年的 DeepSeek-V3、Gemini Flash 更将价格压到了行业新低。
  • 延迟要求多高?:实时聊天 vs 批量处理,对首 token 延迟(TTFT,从发送请求到收到第一个 token 的时间)和吞吐量(TPS,每秒生成 token 数)的要求天差地别。
  • 数据能出本地吗?:金融/医疗/政务等敏感数据可能不允许调外部 API,必须用本地部署的开源模型。

2025 年格局变化:DeepSeek-V3/R1 的横空出世、Claude 3.5 Sonnet 的持续领先、Gemini 2.0 的超长上下文、以及 Llama 3.3 / Qwen 2.5 在开源界的全面发力,使得”闭源 vs 开源”的能力差距大幅缩小,而价格差距缩小得更快。选型的核心理念从”选最强的”转向”选性价比最高的组合”。

闭源 API 模型 vs 开源自部署模型

Section titled “闭源 API 模型 vs 开源自部署模型”

这是第一个也是最根本的选择。

闭源 API 模型(GPT-4o、Claude、Gemini 等):

  • 优势:性能最强(尤其推理和多模态)、零运维、开箱即用、自动更新。
  • 劣势:数据必须发送到供应商服务器、按 token 计费长期成本高、供应商锁定(vendor lock-in,过度依赖单一供应商导致难以迁移的风险)、依赖网络稳定性。
  • 适用:绝大多数初创项目、原型验证、对数据隐私无硬性要求的应用。

开源自部署模型(Llama、Qwen、DeepSeek、Mistral 等):

  • 优势:数据完全自控、无按量计费(只有硬件成本)、可自由微调、无供应商锁定。
  • 劣势:需要 GPU 硬件或云 GPU(成本不低)、运维复杂(推理引擎部署、负载均衡、监控)、性能通常略弱于顶配闭源模型(但差距在快速缩小)。
  • 适用:数据隐私敏感(金融/医疗/政务)、超大规模调用(API 费用超过自建成本)、需要深度定制微调。

2025 年开源的突破性进展:DeepSeek-V3 以 671B 参数的 MoE(Mixture of Experts,混合专家模型,每次推理只激活部分参数,兼具大模型能力和小模型速度)架构实现了逼近 GPT-4o 的性能,而 API 价格仅为 GPT-4o 的 1/10。DeepSeek-R1 更是以纯强化学习训练达到了 o1 级别的推理能力,且完全开源。这意味着”开源模型能力不够”不再是默认假设——在你的具体任务上,开源模型可能已经够用甚至更优。

对于同系列的模型,参数规模(parameter count,模型中可学习权重变量的总数)越大能力越强,但成本和延迟也越高。以常见规模分档:

  • 小模型(1B-8B):Qwen2.5-7B、Llama-3.1-8B、Gemma-2-9B、Phi-4(14B 但效率极高)等。速度快、成本低,适合简单分类、提取、路由、轻量对话。自部署时可在单张消费级 GPU(如 RTX 4090)上运行,推理速度可达 100+ tokens/s。
  • 中型模型(8B-70B):Llama-3.3-70B、Qwen2.5-72B、DeepSeek-V3(671B MoE,每次只激活 37B)等。能力与 GPT-4 有差距但显著缩小,适合中复杂度推理和生成。自部署需要多 GPU(如 2-4 张 A100)。
  • 大模型(70B+):GPT-4o、Claude 3.5 Sonnet、Gemini 2.0 Pro(闭源),Llama-3.1-405B、DeepSeek-V3(开源)等。推理能力最强,适合复杂代码、数学、多步推理、Agent 场景。

实际选择建议:先用小模型跑通流程,能力不够再升级。 大多数应用场景中,70B 级别模型(或等量的 MoE 模型)的性价比最高。

MoE 模型的特殊考量:DeepSeek-V3、Mixtral 等 MoE 模型的总参数量很大(如 671B),但每次推理只激活一小部分(如 37B)。这意味着:(1) 推理速度接近 37B 的稠密模型;(2) 显存需求仍然要装下全部 671B 参数(除非用 offloading 技术);(3) API 价格按激活参数计算,远低于等性能的稠密模型。

不同模型在不同任务上的表现差异很大,不能只看综合排行榜分数:

  • 代码生成:Claude 3.5 Sonnet 被广泛认为是 2025 年初最佳代码模型;DeepSeek-Coder-V2、GPT-4o 紧随其后。开源方面,DeepSeek-V3、Qwen2.5-Coder 在自部署场景有优势。详见 AI 编程助手。
  • 中文理解:Qwen 系列、DeepSeek、GLM 等中文优化模型在中文任务上显著优于纯英文模型。这不仅体现在语义理解上,还体现在 token 效率上——中文在 Qwen 的 tokenizer(分词器)中可能 1 个汉字 = 1 个 token,而 GPT-4o 可能需要 2-3 个 token 编码同一个汉字,直接影响成本。详见Tokenizer 分词器详解。
  • 多模态(同时处理文本、图像、音频等多种数据类型的能力):GPT-4o、Gemini 2.0、Claude 3.5 Sonnet 支持图像输入。如果需要图文理解,必须选多模态模型。详见多模态 LLM。
  • 长上下文(模型单次能处理的最大文本长度):Gemini 2.0(1M-2M token)、Claude 3.5(200K)、GPT-4o(128K)支持超长上下文。需要处理长文档时优先考虑。但注意”支持”不等于”用好”——lost-in-the-middle 现象意味着超长上下文中部的信息容易被忽略。详见上下文工程。
  • 推理与数学:OpenAI o1/o3 系列、DeepSeek-R1 等推理增强模型(reasoning model,在回答前先做内部”思维链”推理的模型)在复杂数学和逻辑推理上远超通用模型。Agent 和工具调用场景也表现更好。这些模型的首 token 延迟较高(因为要先”想”很久),不适合实时聊天。

以下按闭源和开源分类,列出撰写本文时(2025 年初)的主要模型及其定位:

闭源模型:

模型定位上下文窗口核心优势
GPT-4o通用旗舰128K全模态(文本+图像+音频),均衡全面
o1 / o3推理特化200K复杂数学/代码/科学推理,内部思维链
Claude 3.5 Sonnet代码与分析200K代码生成最佳,长文档分析,计算机使用能力
Claude 3.5 Haiku轻量高效200K速度快、价格低,能力不输早期 GPT-4
Gemini 2.0 Pro超长上下文1M-2M最长上下文窗口,原生多模态,Flash 系列极具性价比
Gemini 2.0 Flash性价比1M极低延迟和价格,适合高并发场景

开源模型:

模型参数规模架构核心优势
DeepSeek-V3671B (MoE, 激活 37B)MoE接近 GPT-4o 性能,API 价格极低,训练成本仅 $5.6M
DeepSeek-R1671B (MoE)MoE + RLo1 级推理能力,完全开源(含训练方法),可蒸馏为小模型
Qwen2.5-72B72B稠密中文最佳开源模型,全面均衡,工具调用能力强
Qwen2.5-Coder-32B32B稠密代码专用,接近 GPT-4 级别的编程能力
Llama 3.3-70B70B稠密Meta 旗舰,英文任务强,生态最成熟
Mistral Large 2123B稠密欧洲队代表,多语言能力强
Phi-414B稠密微软出品,小体积大能力,适合边缘部署

⚠️ 以上信息基于 2025 年初的公开资料,模型迭代极快(通常每 3-6 个月就有新一代发布),请以各供应商官方页面为准。

API 模型的成本 = 输入 token 数 × 输入单价 + 输出 token 数 × 输出单价。注意输出通常比输入贵 3-5 倍(因为生成比理解更耗算力)。

估算步骤:

  1. 估算单次请求的输入 token(系统提示词 + 用户输入 + 检索内容 + 历史对话)。
  2. 估算单次请求的输出 token(通常 200-1000)。
  3. 乘以预计日调用量,再乘以 30 得月费用。
  4. 对比不同模型的价格差异——通常用便宜模型处理简单请求、贵模型处理复杂请求的混合策略最省钱。

Prompt Caching 的省钱效果:2024-2025 年,OpenAI、Anthropic、Google 都推出了 prompt caching(提示词缓存)功能——如果多次请求的 system prompt 或前缀相同,供应商会缓存其处理结果,后续请求的输入价格降低 50%-90%。对于 RAG 系统(system prompt + 检索内容往往重复)和长对话(历史消息重复发送),prompt caching 能显著降本。

自部署模型的成本 = GPU 小时费(或折旧)+ 运维人力。当月 API 费用超过自部署成本时,迁到自部署更划算。粗略估算:一张 A100 80GB 的月成本约 $2000-4000(云租赁),如果月 API 费用超过这个数,自部署 70B 级别模型在经济上就划算了。

  • 首 token 延迟(TTFT, Time To First Token):从发送请求到收到第一个 token 的时间。实时聊天场景(如客服机器人)对此敏感,应选小模型或使用流式输出(streaming,逐 token 返回而非等全部生成完再返回)。推理模型(o1/o3)的 TTFT 可能高达 10-60 秒(因为要先做内部思维链),不适合实时场景。
  • 吞吐量(TPS, Tokens Per Second):每秒生成 token 数。批量处理场景(如文档摘要)对吞吐量敏感。Gemini 2.0 Flash 和 Claude 3.5 Haiku 的吞吐量可达 100+ TPS。
  • 并发能力:API 有速率限制(RPM = 每分钟请求数,TPM = 每分钟 token 数),自部署受限于 GPU 数量和显存。使用 vLLM 等推理引擎的连续批处理(continuous batching)技术可以大幅提升自部署的并发吞吐。

如果需要模型深度适配特定领域(医疗、法律、内部知识体系等),微调(fine-tuning,用领域数据进一步训练模型权重以适配特定任务)能力是选型的重要维度:

  • 开源模型可以自由微调。详见LLM 微调技术。
  • 闭源 API 模型中,OpenAI 支持有限的自定义微调(需付费且有最低数据量要求),Claude/Gemini 目前不支持微调。
  • 2025 年的替代方案:即使不能微调闭源模型,也可以用”蒸馏微调”策略——用 GPT-4o/Claude 生成大量高质量领域问答数据,然后微调一个开源小模型来模仿其输出。这比直接微调闭源模型更可控且成本更低。

推理模型 vs 通用模型:2025 年的新选择

Section titled “推理模型 vs 通用模型:2025 年的新选择”

2024-2025 年最重要的模型分化趋势之一是”推理模型”的兴起:

维度通用模型(GPT-4o, Claude 3.5, Gemini)推理模型(o1/o3, DeepSeek-R1)
思考方式直接生成答案先内部”思考”(思维链),再生成答案
适用场景日常对话、写作、简单代码、多模态复杂数学、科学推理、竞赛编程、多步逻辑
延迟快(TTFT 通常 < 1s)慢(TTFT 可能 10-60s,因为要先”想”)
成本标准更高(思维链消耗大量输出 token)
工具调用好较弱(部分推理模型不支持 function calling)

选择建议:不要默认用推理模型。只在真正需要复杂推理(数学证明、算法设计、多步逻辑分析)时才用推理模型;日常任务用通用模型更快更便宜。一个常见的混合策略是:通用模型做路由判断,复杂推理任务才转发给推理模型。

推理模型 vs 通用模型的适用范围

Section titled “推理模型 vs 通用模型的适用范围”
# 模型价格参考(2025年初,美元/百万token,以官方公布为准)
MODEL_PRICING = {
# 闭源旗舰
"gpt-4o": {"input": 2.50, "output": 10.00},
"gpt-4o-mini": {"input": 0.15, "output": 0.60},
"claude-3.5-sonnet": {"input": 3.00, "output": 15.00},
"claude-3.5-haiku": {"input": 0.80, "output": 4.00},
"gemini-2.0-flash": {"input": 0.10, "output": 0.40},
# 开源 API
"deepseek-v3": {"input": 0.27, "output": 1.10},
"deepseek-r1": {"input": 0.55, "output": 2.19},
}
def estimate_monthly_cost(model, input_tokens, output_tokens, daily_calls):
"""估算月度 API 费用"""
p = MODEL_PRICING[model]
daily_cost = (
input_tokens * p["input"] / 1_000_000
+ output_tokens * p["output"] / 1_000_000
) * daily_calls
monthly = daily_cost * 30
return monthly
# 场景: RAG 聊天机器人,每天 1000 次调用
# 每次输入约 2000 token(含检索内容),输出约 500 token
for model in ["gpt-4o", "gpt-4o-mini", "claude-3.5-sonnet",
"gemini-2.0-flash", "deepseek-v3"]:
cost = estimate_monthly_cost(model, 2000, 500, 1000)
print(f"{model:25s}: ${cost:.2f}/月")
# gpt-4o : $300.00/月
# gpt-4o-mini : $24.00/月
# claude-3.5-sonnet : $525.00/月
# gemini-2.0-flash : $21.00/月
# deepseek-v3 : $53.10/月
#
# 结论:gemini-2.0-flash 和 gpt-4o-mini 是性价比之王;
# deepseek-v3 以开源价格提供接近旗舰的能力。

用 LLM 做智能路由(Model Routing)

Section titled “用 LLM 做智能路由(Model Routing)”

模型路由(Model Routing,根据请求复杂度自动选择不同规模模型以优化成本)是最有效的省钱策略:

import openai
client = openai.OpenAI()
def route_and_answer(question):
"""根据问题复杂度自动选择模型"""
# 第一步: 用小模型判断问题复杂度
resp = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{
"role": "user",
"content": (
"判断以下问题的复杂度。只输出一个词:\n"
"- simple(简单事实/闲聊/格式转换)\n"
"- complex(需要推理/代码/数学/长文生成)\n\n"
f"问题: {question}"
),
}],
max_tokens=5,
)
complexity = resp.choices[0].message.content.strip().lower()
# 第二步: 简单问题用便宜模型,复杂问题用强模型
model = "gpt-4o-mini" if "simple" in complexity else "gpt-4o"
print(f"路由到: {model}")
answer = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": question}],
max_tokens=500,
)
return answer.choices[0].message.content
# 简单问题 → gpt-4o-mini(省钱)
print(route_and_answer("北京是哪个国家的首都?"))
# 复杂问题 → gpt-4o(保质量)
print(route_and_answer("请用 Rust 实现一个线程安全的 LRU 缓存"))

用 LiteLLM 统一接口做多模型 A/B 测试

Section titled “用 LiteLLM 统一接口做多模型 A/B 测试”
"""
LiteLLM 提供统一的 OpenAI 兼容接口,可以一行代码切换底层模型。
适合做多模型对比测试或实现主备模型切换。
"""
# pip install litellm
from litellm import completion
import os
# 同一个函数,只需改 model 参数即可切换底层供应商
models_to_test = [
"gpt-4o", # OpenAI
"claude-3-5-sonnet-20241022", # Anthropic
"gemini/gemini-2.0-flash", # Google
"deepseek/deepseek-chat", # DeepSeek
]
question = "请解释什么是向量数据库,以及它在 AI 应用中的作用。"
for model in models_to_test:
try:
resp = completion(
model=model,
messages=[{"role": "user", "content": question}],
max_tokens=300,
api_key=os.environ.get("OPENAI_API_KEY"), # 各供应商 key 通过环境变量设置
)
answer = resp.choices[0].message.content
cost = resp._hidden_params.get("response_cost", "?")
print(f"\n{'='*60}")
print(f"模型: {model} | 估算费用: ${cost}")
print(f"回答: {answer[:200]}...")
except Exception as e:
print(f"{model}: 调用失败 - {e}")
  • 先用 API 验证再考虑自部署:先用闭源 API 快速跑通产品和验证需求,等调用规模大了或有隐私合规需求时再迁到开源模型。过早自部署是过度工程。
  • 混合路由省钱:90% 的请求是简单的,用便宜模型处理;10% 复杂请求才用贵模型。上面的 Model Routing 代码可以省 70% 以上的 API 费用。2025 年,DeepSeek-V3 和 Gemini Flash 的价格已经低到”几乎不需要路由”的程度,但对于大批量处理场景仍然值得。
  • 不要只看排行榜:LMSYS Chatbot Arena 等排行榜是综合分数,和你的具体任务可能不相关。一定要在自己的业务数据上做评测(详见 LLM 评测与基准),用 A/B 测试验证实际效果。建议构建一个 50-100 条的领域评测集,每次换模型时跑一遍。
  • 关注模型的上下文窗口:不要因为”支持 128K”就觉得真的能用好 128K。实际有效利用长度可能远小于标注值——“lost in the middle”现象表明,放在上下文中部的信息容易被忽略。详见上下文工程。
  • 考虑生态和工具链:模型选择不只是模型本身,还包括 SDK 成熟度、社区生态、调试工具、微调支持等。OpenAI/Anthropic 的生态最成熟,新项目首选。但如果团队有较强的工程能力,DeepSeek/Qwen + vLLM 的自建方案可以节省大量成本。
  • 设置备份模型:单一供应商有宕机和限流风险(2024 年 OpenAI、Anthropic 都发生过数小时级宕机)。生产系统应配置主备模型,主模型不可用时自动降级到备用模型。LiteLLM、OpenRouter 等工具支持自动回退(fallback)。
  • 善用 prompt caching:如果你的请求有大量重复前缀(system prompt、RAG 检索结果、长对话历史),务必启用 prompt caching。OpenAI 和 Anthropic 的缓存命中可降低 50%-90% 的输入 token 费用。
  • 推理模型不要滥用:o1/o3/R1 等推理模型虽然推理能力更强,但延迟高、成本高(思维链 token 也计费),且部分不支持 function calling 和多模态。只在真正需要复杂推理时使用。
  • 关注 tokenizer 效率:同样的中文文本,不同模型的 token 数可能差 2-3 倍,直接影响成本和速度。中文为主的场景优先考虑 Qwen、DeepSeek 等中文友好的模型。详见Tokenizer 分词器详解。
  • 通用聊天机器人 / 客服:Gemini 2.0 Flash 或 GPT-4o-mini 性价比最高,能力足够应对绝大多数客服场景。月费可控制在 $20-30 级别(1000 次/天调用量)。
  • AI 编程助手:Claude 3.5 Sonnet 是 2025 年初公认的最佳代码模型,GPT-4o 紧随其后。自部署场景可用 DeepSeek-V3 或 Qwen2.5-Coder。详见 AI 编程助手。
  • RAG 问答系统:检索用便宜模型做查询改写,生成用中等模型做答案合成。DeepSeek-V3 在 RAG 场景的性价比极高。详见 RAG 检索增强生成。
  • 企业私有部署:金融/医疗/政务等场景,用 Qwen2.5-72B 或 DeepSeek-V3 等开源模型自部署。详见LLM 推理优化。
  • AI Agent / 复杂推理:o1/o3 系列或 Claude 3.5 Sonnet 的推理能力最强,适合多步规划和工具调用。DeepSeek-R1 是开源推理模型的首选。详见 AI Agent。
  • 超长文档处理:Gemini 2.0(1M-2M token)是唯一能单次处理整本书或大型代码库的模型。其他模型需要分段处理 + RAG。
工具 / 服务类型说明
LMSYS Chatbot Arena评测平台众包盲测排行榜,反映模型的真实人类偏好排名,选型必备参考
OpenRouterAPI 聚合统一 API 接口访问 200+ 模型,支持自动回退和成本控制,适合多模型策略
LiteLLMPython 库统一 OpenAI/Anthropic/Google/DeepSeek 等 100+ 模型的 SDK 接口,简化模型切换
Artificial Analysis评测网站提供模型性能-成本-延迟的三维对比图表,选型决策利器
vLLM推理引擎开源模型高性能推理框架,自部署首选,详见 LLM 推理优化
HuggingFace Open LLM Leaderboard评测平台开源模型的标准化评测排行榜,开源选型必备
Ollama本地推理一键在本地运行开源模型(Llama、Qwen、DeepSeek 等),适合开发测试
SGLang推理引擎新一代高性能推理引擎,支持 RadixAttention 加速重复前缀处理
术语英文解释
闭源模型Closed-source Model仅通过 API 提供服务、权重不公开的模型(如 GPT-4o、Claude)
开源模型Open-source Model权重公开、可自部署的模型(如 Llama、Qwen、DeepSeek)
混合专家模型MoE, Mixture of Experts每次推理只激活部分参数的架构,兼具大模型能力和小模型速度
推理模型Reasoning Model在回答前先做内部思维链推理的模型(如 o1、DeepSeek-R1),擅长复杂逻辑但延迟较高
模型路由Model Routing根据请求复杂度自动选择不同规模模型以优化成本
首 token 延迟TTFT, Time To First Token从发送请求到收到第一个 token 的时间,影响用户体验
吞吐量TPS, Tokens Per Second每秒生成的 token 数,衡量模型的生成速度
速率限制Rate LimitAPI 供应商对每分钟请求数和 token 数的限制
供应商锁定Vendor Lock-in过度依赖单一供应商导致难以迁移的风险
混合部署Hybrid Deployment同时使用 API 和自部署模型的策略,取长补短
提示词缓存Prompt Caching缓存重复前缀的处理结果,降低后续请求的输入 token 费用
连续批处理Continuous Batching推理引擎技术,动态将多个请求合并处理以提升 GPU 利用率
蒸馏Distillation用大模型的输出训练小模型,使小模型获得接近大模型的能力
  • LMSYS Chatbot Arena 官网(chatbotarena.ai):最权威的 LLM 人类偏好排行榜,使用 Elo 评分系统(国际象棋中用于衡量选手相对水平的评分方法),是闭源模型选型的首选参考。
  • HuggingFace Open LLM Leaderboard:开源模型的标准化评测排行榜,使用统一的评测套件,选开源模型必看。
  • Artificial Analysis 官网(artificialanalysis.ai):提供模型能力-成本-延迟的三维对比可视化,非常适合做选型决策。
  • DeepSeek-V3 / R1 技术报告:DeepSeek AI 发布的开源技术报告,详细披露了 MoE 架构设计和强化学习训练方法,是理解 2025 年开源前沿的重要参考。
  • OpenAI / Anthropic / Google / DeepSeek 官方定价页面:各供应商官方 API 定价,选型时务必查阅最新价格(变化频繁)。
  • vLLM 官方文档:开源模型高性能推理部署的首选框架文档,详见 LLM 推理优化。