OpenClaw/Hermes 与开源Agent生态
AI Agent(智能代理)是 LLM 从「对话工具」进化为「自主行动者」的关键一步——大模型不再只回答问题,而是能规划任务、调用工具、反思错误、迭代完成目标。本页拆解开源 Agent 生态的技术架构,涵盖 Hermes 模型系列、MetaGPT、CrewAI、AutoGen、LangGraph 等框架,并演示如何从零搭建一个完整的 Agent 循环。前置阅读:LLM Agent 与工具调用、MCP 与工具协议、LLM 推理。
把 AI Agent 想象成「带工具箱的实习生」——
- 普通 LLM 对话 = 百科全书:你问什么它答什么,但它不能帮你发邮件、查数据库、写文件。知识在脑子里,手脚被绑住了。Transformer(一种基于自注意力机制的神经网络架构,是现代大语言模型的基石)本身只是个文本生成器——给它前文,它预测下一个 token(文本的最小单位)。
- AI Agent = 带工具箱的实习生:你给一个目标(“调研竞品并写一份分析报告”),Agent 自己规划步骤(先搜索 → 整理信息 → 写大纲 → 生成报告),遇到问题会调整策略,使用工具(搜索引擎、代码执行器、文件系统)完成任务。
- 多 Agent 系统 = 一个项目团队:MetaGPT 模拟软件开发团队(产品经理 + 架构师 + 程序员 + 测试),各角色分工协作,通过”对话”推进项目。微软的 Magentic-One 则是一支可以浏览网页、执行代码、管理文件的多 Agent 团队。
Agent 的核心要素:LLM(大脑)+ 工具(双手)+ 记忆(经验)+ 规划(策略)+ 反思(纠错)。
技术架构拆解
Section titled “技术架构拆解”Agent 核心循环:ReAct 模式
Section titled “Agent 核心循环:ReAct 模式”大多数 Agent 框架的核心是 ReAct(Reasoning + Acting)循环(详见 LLM Agent 与工具调用)。ReAct 的本质是让 LLM 在每一步都「先想后做」:
- Thought(思考):LLM 推理当前状态,决定下一步做什么。这一步的输出是自然语言推理链(chain-of-thought),让模型的决策过程可审计。
- Action(行动):调用一个工具(搜索、代码执行、API 调用)。工具调用的格式由 LLM 的 function calling(函数调用,即模型输出结构化的 JSON 来描述要调用哪个函数、传什么参数)能力决定。
- Observation(观察):接收工具返回的结果,作为新的上下文追加进对话历史。
- 循环:根据观察结果继续思考-行动,直到任务完成。
每一轮的 Thought 和 Action 都通过 提示工程 构造 prompt 来引导模型输出,循环中的所有中间结果累积进上下文窗口(context window,即模型一次推理能”看到”的 token 数量上限),形成完整的多轮推理轨迹。
为什么 ReAct 有效? 研究表明,让 LLM 显式输出推理过程(而非直接跳到结论),可以显著减少幻觉(hallucination,模型编造不存在的事实)并提高工具调用的准确率。推理链相当于模型的”草稿纸”,在输出最终行动前先理清逻辑。Hermes 4 系列进一步引入了 GOAP(Goal Oriented Action Planning,目标导向行动规划)框架,用
<scratch_pad>标签让模型在调用工具前先记录目标、行动计划、观察反思——这是 ReAct 模式的工程化升级。
工具调用机制
Section titled “工具调用机制”Agent 通过 Function Calling / Tool Use 接口调用外部工具(详见 MCP 与工具协议):
- LLM 原生 Function Calling:现代 LLM(GPT-4o、Claude、Qwen、Hermes 4)内置 function calling 能力,模型输出结构化的函数调用 JSON(详见 结构化输出),框架执行后把结果返回给模型。关键点在于:模型本身并不”执行”函数,它只是输出一段描述”我想调用这个函数”的 JSON,实际执行由外部代码完成。
- MCP(Model Context Protocol):Anthropic 在 2024 年底提出、2025 年迅速普及的标准化工具协议。它让 Agent 以统一接口接入各种外部工具和数据源(数据库、文件系统、API),类似”AI 的 USB-C 接口”——写一次工具适配器,所有支持 MCP 的 AI 应用(Claude、ChatGPT、Cursor、VS Code 等)都能使用。截至 2025 年,MCP 已获得广泛生态支持,成为 Agent 工具接入的事实标准。
- A2A(Agent-to-Agent)协议:Google 在 2025 年推出的 Agent 间通信标准,让不同框架构建的 Agent 可以互相发现、协商和协作。如果说 MCP 解决的是”Agent 如何连接工具”,A2A 解决的则是”Agent 如何连接其他 Agent”。
- 代码执行器:Agent 可以生成并执行 Python/JavaScript 代码(如沙箱中的 Python 解释器),用于数据分析、数学计算、文件处理等复杂任务。生产环境通常用 Docker 容器或 e2b 等云端沙箱服务隔离执行,防止恶意代码逃逸。
Agent 的记忆分为两层(详见 RAG 检索增强生成)。RAG(Retrieval-Augmented Generation,检索增强生成)是一种让 LLM 在回答前先从外部知识库检索相关信息的技术,相当于给模型一本可以随时翻阅的参考书:
- 短期记忆:当前对话/任务上下文,存在 LLM 的上下文窗口中。受窗口大小限制(现代模型通常为 32K-256K token),需要摘要压缩管理。当对话超过窗口时,需要截断旧消息或用摘要替代——CrewAI、LangGraph 等框架都内置了上下文管理策略。
- 长期记忆:跨任务的经验积累,用向量数据库(vector database,一种专门存储和检索高维向量的数据库,通过计算向量间的相似度来找到语义相近的内容)存储和检索。Agent 可以回忆”上次遇到类似问题是怎么解决的”。记忆的写入通常是将文本通过 embedding 模型(嵌入模型,把文本转化为高维向量)编码后存入向量库,检索时用相似度搜索(similarity search)找到最相关的历史片段。
关键技术点详解
Section titled “关键技术点详解”主流开源 Agent 框架对比
Section titled “主流开源 Agent 框架对比”| 框架 | 开发者 | 核心特点 | 商业模式 | 适用场景 |
|---|---|---|---|---|
| MetaGPT | FoundationAgents / DeepWisdom | 多 Agent 角色扮演,模拟软件团队协作 | 开源框架 + MGX 商业产品(SaaS 订阅) | 自动化软件开发、需求到代码 |
| CrewAI | CrewAI Inc. | 角色分工 + 任务委派,Crews + Flows 双模式 | 开源框架 + CrewAI AMP 企业套件(托管部署、可观测性) | 多步骤工作流自动化、企业级 Agent |
| AutoGen | 微软(已转维护模式) | 多 Agent 对话式协作,支持人类参与 | 开源(MIT),微软推荐迁移至 Microsoft Agent Framework | 研究助手、代码生成与调试 |
| Microsoft Agent Framework | 微软 | AutoGen 的企业级继任者,支持多模型 + A2A/MCP | 开源 + Azure 云服务集成 | 企业级多 Agent 编排 |
| LangGraph | LangChain Inc. | 基于图的状态机,持久化执行 | 开源框架 + LangSmith(可观测性 + 部署平台,SaaS 订阅) | 复杂流程编排、生产级系统 |
| Hermes 系列 | NousResearch | 开放权重 LLM,专为 Agent/function calling 优化 | 开放权重免费下载 + 自营 API 服务 | 本地部署 Agent、隐私敏感场景 |
各框架的技术选型建议
Section titled “各框架的技术选型建议”- 快速原型 / 学习入门 → CrewAI:API 最简洁,
crewai create crew一键生成项目骨架,YAML 配置 Agent 角色和任务,10 分钟跑通第一个多 Agent demo。适合想快速验证想法的团队。 - 需要精确控制流程 / 生产级系统 → LangGraph:基于有向图的状态机模型,支持持久化执行(durable execution,即 Agent 崩溃后可从断点恢复)、human-in-the-loop(人工审批节点)、条件分支。Klarna、Replit、Elastic 等公司已在生产环境使用。适合对可靠性和可审计性要求高的场景。
- 软件开发自动化 → MetaGPT:内置 SOP(Standard Operating Procedure,标准操作流程),模拟完整软件公司流程。2025 年 2 月推出商业产品 MGX(MetaGPT X),定位为”自然语言编程平台”。
- 企业级 / Azure 生态 → Microsoft Agent Framework (MAF):微软 2025 年发布的 AutoGen 继任者,1.0 版本已生产就绪,支持多模型提供商、A2A 和 MCP 互操作,与 Azure AI 服务深度集成。
- 本地部署 / 数据隐私 → Hermes + Ollama:模型权重完全开放,可离线运行,数据不出本地。详见 Ollama 与 Open WebUI。
Hermes:为 Agent 而生的开放权重模型
Section titled “Hermes:为 Agent 而生的开放权重模型”Hermes 是 NousResearch 发布的开放权重 LLM 系列,专门针对 Agent 和工具调用场景优化。其核心价值主张是:你不需要依赖 OpenAI/Anthropic 的 API,也能获得一流的 function calling 能力——这对数据隐私敏感的企业(金融、医疗、法律)和需要离线运行的场景至关重要。
| 版本 | 基座 | 关键特性 | 发布时间 |
|---|---|---|---|
| Hermes 2 Pro | Llama 3 (8B) | 首个成熟的 function calling + JSON mode | 2024 |
| Hermes 3 | Llama 3.1 (405B/70B/8B) | 引入 GOAP 推理框架,<scratch_pad> 规划标签 | 2024 末 |
| Hermes 4 | Llama 3.1 (405B/70B/14B) | 增强推理能力、多轮工具调用稳定性提升 | 2025 年 8-9 月 |
| Hermes 4.3 | 自研 36B 架构 | 中等参数量级的性能/成本平衡,提供 GGUF 量化版 | 2025 年 12 月 |
- 基于开源基座微调:Hermes 系列基于 Llama / Qwen 等开源模型做指令微调(instruction tuning,用大量高质量的指令-回复对训练模型遵循人类指令)。关键是训练数据中包含大量 function calling 格式的对话,使模型学会在恰当时机输出
<tool_call>标签包裹的 JSON。 - ChatML 提示格式:Hermes 使用 ChatML(Chat Markup Language)格式,用
<|im_start|>/<|im_end|>标签标记每个对话轮次的开始和结束。这种格式与 OpenAI API 兼容,降低了迁移成本。 - GOAP 推理框架(Hermes 3+ 引入):模型在调用工具前,先在
<scratch_pad>中记录四个部分——Goal(复述任务目标)、Actions(计划调用的函数)、Observation(工具返回结果的摘要)、Reflection(评估当前进度、判断工具是否相关)。这种结构化推理显著减少了”选错工具”和”参数填错”的问题。 - 量化部署(quantization):Hermes 4.3-36B 提供 GGUF 格式的量化版本(量化是一种压缩技术,把模型权重从 16-bit 浮点数降到 4-bit/8-bit,牺牲少量精度换取大幅减少内存占用和推理速度提升)。配合 llama.cpp 或 Ollama,可以在单张消费级 GPU(如 RTX 4090)上运行 36B 参数模型。
- 推理流程依赖 LLM 推理 引擎(如 vLLM、llama.cpp、Ollama)来加载和运行。流式推理(streaming inference,即模型生成 token 时就逐个返回而非等全部生成完毕)在 Agent 场景中尤其重要——它让用户能看到模型的思考过程,显著改善交互体验。
商业模式与竞争格局
Section titled “商业模式与竞争格局”Hermes 采用「开放权重 + 自营 API」的双轨模式:模型权重在 Hugging Face 上免费下载(但使用需遵守基座模型的许可证,如 Llama 的社区许可),同时 NousResearch 提供付费 API 托管服务。其竞争对手包括:
- Qwen 系列(阿里):同样支持 function calling 和开放权重,中文能力更强,生态更活跃。
- DeepSeek 系列:以极高的性价比著称,DeepSeek-R1 的推理能力可与 GPT-4o 竞争。
- Llama 系列(Meta):最大的开放权重生态,但原生 function calling 能力需要额外微调。
Hermes 的差异化优势在于 Agent 场景的深度优化(GOAP 框架、训练数据质量)和对中立性的追求(模型审查更少、可定制性更高)。
OpenClaw:领域专用 Agent
Section titled “OpenClaw:领域专用 Agent”OpenClaw 是法律/文书领域的开源 Agent 项目,展示了 Agent 技术在垂直领域的落地模式:
- 领域知识注入:法律领域的专业知识通过 RAG(详见上文记忆系统)注入——将法律法规、判例、合同模板等文档向量化存入向量数据库,Agent 在回答时先检索相关条文再生成回复,避免模型”编造”法条。
- 文书起草工作流:用户描述需求 → Agent 规划文书结构 → 逐节检索相关法律依据 → 生成完整文书 → 自检合规性。整个流程是一个典型的 ReAct 循环,但每一步的工具和法律知识库都是法律专用的。
- 商业模式:开源核心引擎 + 专业版订阅(提供更全的法律数据库、多人协作、审计日志),这是法律科技领域常见的”open-core”模式。
⚠️ 注意:法律 Agent 生成的文书仅供参考,不能替代执业律师的法律意见。领域 Agent 的价值在于提升效率(快速起草初稿、检索先例),而非替代专业判断。
自己搭建 Agent 系统的关键决策
Section titled “自己搭建 Agent 系统的关键决策”- 选择基座模型:需要强推理能力时选 GPT-4o / Claude 4 / DeepSeek-R1;需要本地部署时选 Qwen 2.5 / Hermes 4。LoRA(Low-Rank Adaptation,低秩适配,一种只微调少量参数就能让模型适应特定任务的高效微调方法)可以用来在开源基座上注入领域知识。不同模型的推理速度和成本差异很大,详见 LLM 推理。
- 定义工具集:为 Agent 提供合适的工具接口。工具太少,Agent 完不成任务;工具太多,模型会选错。每个工具要有清晰的描述和参数 schema(用 JSON Schema 或 Pydantic 定义)。经验法则:不超过 10-15 个工具;超过时考虑分层架构(一个 router Agent 负责选择子 Agent,子 Agent 各持有自己的工具子集)。
- 设计系统提示:Agent 的行为模式很大程度上由系统 prompt 决定——告知模型可用工具、输出格式、停止条件。这是 提示工程 在 Agent 场景的核心应用。
- 设计停止条件:Agent 不能无限循环——设置最大迭代次数、结果质量检查、用户确认中断点。LangGraph 的 human-in-the-loop 机制允许在关键步骤暂停等待人工审批。
- 错误处理:工具调用失败时,Agent 应能理解错误并调整策略(换工具、换参数、放弃当前路径),而非卡住重复尝试。在工具返回的错误信息中包含修复建议(如”参数 X 应为整数而非字符串”),可以显著提高模型的自纠错率。
- 安全护栏:限制 Agent 的行动范围,如代码执行用沙箱隔离(Docker 容器、gVisor、或云端沙箱如 e2b)、文件系统只限指定目录、API 调用设白名单。CrewAI AMP 提供 enterprise 级的治理和安全控制。
以下代码从零实现一个完整的 Agent 核心循环——包含 function calling、多轮对话记忆、以及自动迭代停止条件。使用 OpenAI 兼容接口(可对接本地 Ollama 或远程 API):
import jsonfrom openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
# 定义两个工具:搜索和计算def search_web(query): return f"搜索结果:{query} 的相关信息..."
def calculate(expression): try: return str(eval(expression)) # 生产环境请用安全沙箱 except Exception as e: return f"计算失败:{e}"
# 工具注册表(名称 → 函数 + schema 描述)TOOLS = { "search_web": {"fn": search_web, "schema": {"type": "function", "function": { "name": "search_web", "description": "搜索互联网获取信息", "parameters": {"type": "object", "properties": {"query": {"type": "string"}}, "required": ["query"]}}}}, "calculate": {"fn": calculate, "schema": {"type": "function", "function": { "name": "calculate", "description": "执行数学计算", "parameters": {"type": "object", "properties": {"expression": {"type": "string"}}, "required": ["expression"]}}}},}
# Agent 核心循环:多轮记忆 + 工具调用 + 自动停止def run_agent(user_input, max_turns=8): messages = [ # 记忆:累积完整对话历史 {"role": "system", "content": "你是一个能调用工具的助手。完成用户任务后直接给出最终答案。"}, {"role": "user", "content": user_input}, ] for turn in range(max_turns): # 防止无限循环 resp = client.chat.completions.create( model="qwen2.5:7b", # 也可换成 hermes3:8b 等支持 function calling 的本地模型 messages=messages, tools=[t["schema"] for t in TOOLS.values()], ) msg = resp.choices[0].message messages.append(msg) # 记入记忆 if not msg.tool_calls: # 模型不再调用工具 → 任务完成 return msg.content for tc in msg.tool_calls: # 执行每个工具调用 name = tc.function.name args = json.loads(tc.function.arguments) result = TOOLS[name]["fn"](**args) # 调用实际函数 messages.append({"role": "tool", # 工具结果回传给模型 "tool_call_id": tc.id, "content": result}) return "已达最大迭代次数,强制停止。"
print(run_agent("搜索 AI Agent 的最新进展,并计算相关论文数量的两倍是多少"))上面的循环实现了 ReAct 的核心:模型思考 → 决定调用工具 → 执行工具 → 结果反馈回上下文 → 模型继续推理,直到模型判断任务完成(不再发起 tool call)或达到最大迭代次数。messages 列表就是 Agent 的短期记忆,每一步的思考、行动、观察都累积其中。
提示:如果想用 Hermes 4 系列替换上面的 Qwen,只需把
model参数改为"hermes4:14b"等模型名(前提是已在 Ollama 中拉取对应模型)。Hermes 的 GOAP<scratch_pad>会在模型输出中自动出现,让你的 Agent 拥有更透明的推理过程。
- 从单 Agent 开始,再扩展到多 Agent:不要一上来就搭复杂的多 Agent 系统。先让一个 Agent 完成完整任务(ReAct 循环),再根据需要拆分角色。多 Agent 的协调成本(Agent 间通信开销、一致性保证、调试难度)远高于单 Agent。CrewAI 的经验法则是:能单 Agent 解决的就不要用多 Agent。
- 工具描述是 Agent 效果的关键:LLM 根据工具描述决定调用哪个工具。描述不清晰,模型会选错或漏用。每个工具描述要包含”什么情况下该用这个工具”和”什么情况下不该用”的说明。工具描述本质上也是一种 prompt engineering。
- 设置最大迭代次数:ReAct 循环可能陷入死循环(反复尝试同一个失败的操作)。务必设置
max_turns(通常 8-20 次),超限后强制返回当前最佳结果。 - 用结构化输出保证格式可靠:工具调用的参数需要严格遵循 schema。用 JSON Schema 或 Pydantic 模型约束输出格式(详见 结构化输出),避免模型输出格式错误导致解析失败。Hermes 4 和 GPT-4o 都支持原生 structured output,能将格式错误率降到极低。
- 生产环境加安全护栏:Agent 能执行代码和调用 API,风险远高于纯对话。代码执行必须在沙箱中(Docker 容器/云端沙箱如 e2b),文件系统限制目录,网络请求设白名单。CrewAI AMP 和 LangSmith 都提供生产级的可观测性,可以追踪每个 Agent 步骤的执行情况。
- 关注 MCP 和 A2A 生态发展:MCP 正在成为 Agent 工具接入的事实标准(详见 MCP 与工具协议),A2A 则在解决 Agent 间互操作问题。优先支持 MCP 的工具,未来兼容性更好。2025 年,Claude、ChatGPT、Cursor、VS Code 等主流 AI 应用都已原生支持 MCP。
典型应用场景
Section titled “典型应用场景”- 自动化软件开发:MetaGPT 模拟软件团队(产品经理写需求 → 架构师设计 → 程序员编码 → 测试工程师验证),从一句话需求生成可运行的代码项目。其 2025 年推出的 MGX 产品将此能力商业化,登上 Product Hunt 周榜第一。微软的 Magentic-One 也是多 Agent 协作完成复杂软件任务的代表。
- 研究与调研助手:用 Microsoft Agent Framework 或 AutoGen 组建研究 Agent 团队,自动搜索、阅读论文、整理对比、生成调研报告。类似 AI 搜索 但更侧重深度多步研究。
- 数据分析与报告生成:Agent 接入数据库和代码执行器,自主编写 SQL/Python 查询数据、可视化分析、生成分析报告。LangGraph 的持久化执行确保长时间的数据处理任务不会因中断而丢失进度。
- 法律/文书 Agent:OpenClaw 等领域专用 Agent,辅助法律咨询、合同审查、文书起草。领域知识通过 RAG 注入。
- 客服与工单处理:Agent 自主处理用户工单——查询订单系统、检查物流状态、生成回复或发起退款流程,减少人工介入。CrewAI 的 Crews + Flows 组合非常适合这类「需要 LLM 推理 + 确定性流程」混合的场景。
- 自动化运维(AIOps):Agent 监控告警、诊断故障、执行修复脚本、记录处理过程。结合 MCP 工具接入服务器管理 API,实现从「告警→诊断→修复」的全自动闭环。
2025-2026 最新进展
Section titled “2025-2026 最新进展”以下信息综合自各项目官方仓库与 Hugging Face 页面(截至 2025 年底 / 2026 年初)。
Agent 框架格局洗牌
Section titled “Agent 框架格局洗牌”- AutoGen 进入维护模式,Microsoft Agent Framework (MAF) 继位:微软宣布 AutoGen 不再添加新功能,转为社区维护的维护模式。其企业级继任者 Microsoft Agent Framework 已于 2025 年发布 1.0 稳定版,支持多模型提供商、A2A 和 MCP 互操作,与 Azure AI 服务深度集成。新项目应直接使用 MAF。
- MetaGPT 推出 MGX 商业产品:2025 年 2 月,FoundationAgents(MetaGPT 团队)正式发布 MGX(MetaGPT X)——定位为”全球首个 AI Agent 开发团队”的自然语言编程平台,登上 Product Hunt 日榜和周榜第一。其学术论文 AFlow(自动化 Agent 工作流生成)获 ICLR 2025 口头报告(top 1.8%)。仓库已迁移至 FoundationAgents/MetaGPT。
- CrewAI 双模式成熟 + 企业级套件:CrewAI 发展出 Crews(自主协作)+ Flows(事件驱动控制)双模式,注册开发者超过 10 万人。其商业产品 CrewAI AMP Suite 提供企业级托管部署、可观测性(tracing)、安全治理,支持云上和本地部署。还推出了面向 AI 编程助手(Claude Code、Cursor 等)的官方 Skills 插件。
- LangGraph 定位「持久化执行」:LangGraph 强化了 durable execution(持久化执行)能力——Agent 可以在崩溃后自动恢复、运行数小时乃至数天。配套推出 Deep Agents(更高层封装)和 LangSmith Studio(可视化原型和部署平台)。Klarna、Replit、Elastic 等公司已在生产中使用。
Hermes 模型更新
Section titled “Hermes 模型更新”- Hermes 4 系列全面发布(2025 年 8-9 月):包括 Hermes-4-405B(FP8 量化)、Hermes-4-70B、Hermes-4-14B 三个尺寸。相比 Hermes 3,增强了推理能力和多轮工具调用的格式稳定性。技术报告同步发布了详细评估数据。
- Hermes 4.3-36B(2025 年 12 月):采用 36B 参数量的自研架构,在性能和部署成本间取得平衡。提供 GGUF 量化版本(可在单张消费级 GPU 上运行),下载量超过 14,000,是目前 Hermes 系列中热度最高的版本之一。
- NousCoder-14B(2025 年初):Hermes 团队推出的编程专用模型,针对代码生成和调试场景优化。
- MCP 生态爆发:2025 年,MCP 从 Anthropic 的提案成长为事实标准。Claude、ChatGPT、Cursor、VS Code、Cline 等主流 AI 应用和开发工具均原生支持。社区涌现大量 MCP Server(覆盖数据库、文件系统、API、浏览器自动化等场景),写一次工具适配器即可在所有支持 MCP 的应用中使用。
- A2A 协议登场:Google 在 2025 年推出 Agent-to-Agent 协议,让不同框架构建的 Agent 可以互相发现和协作。MAF、CrewAI 等框架已宣布支持 A2A。MCP + A2A 的组合正在构建 Agent 互操作的底层基础设施——前者连接工具,后者连接 Agent。
典型类库与工具
Section titled “典型类库与工具”| 类库 / 模型 | 语言 / 类型 | 说明 |
|---|---|---|
| CrewAI | Python | 角色分工式多 Agent 框架,Crews + Flows 双模式,API 简洁,上手快 |
| MetaGPT | Python | 多 Agent 软件开发模拟,需求到代码的自动化;商业版为 MGX |
| Microsoft Agent Framework | Python / .NET | AutoGen 的企业级继任者,多模型支持,A2A/MCP 互操作 |
| AutoGen | Python | 微软多 Agent 对话框架(⚠️ 已进入维护模式,新项目建议用 MAF) |
| LangGraph | Python | 基于图的状态机 Agent 编排,持久化执行,LangChain 生态 |
| Hermes 4 / 4.3(NousResearch) | 开放权重模型 | 专为 Agent 和 function calling 优化的 LLM 系列,支持 GOAP 推理 |
| OpenClaw | Python | 法律/文书领域专用开源 Agent |
| Pydantic / JSON Schema | Python | Agent 工具调用的参数 schema 约束 |
| MCP Servers | 多语言 | 标准化工具适配器,覆盖数据库、文件系统、API 等场景 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 代理 | Agent | 能自主规划、调用工具、反思纠错来完成目标的 LLM 系统 |
| ReAct | Reasoning + Acting | Agent 的核心循环:思考 → 行动 → 观察 → 循环 |
| GOAP | Goal Oriented Action Planning | Hermes 3+ 引入的目标导向推理框架,用结构化标签引导模型规划 |
| 工具调用 | Tool Calling / Function Calling | LLM 输出结构化的函数调用请求(JSON),由框架执行后返回结果 |
| MCP | Model Context Protocol | Anthropic 提出的标准化 Agent 工具接入协议,“AI 的 USB-C 接口” |
| A2A | Agent-to-Agent Protocol | Google 提出的 Agent 间通信和互操作标准 |
| 多 Agent 系统 | Multi-Agent System | 多个分工不同的 Agent 协作完成复杂任务的架构 |
| 规划 | Planning | LLM 将复杂目标拆解为有序子任务的过程 |
| 反思 | Reflection | Agent 评估自身输出质量并调整策略的机制 |
| 短期记忆 | Short-term Memory | 当前任务上下文中累积的对话历史和中间结果,受上下文窗口限制 |
| 长期记忆 | Long-term Memory | 跨任务的持久化经验,通常通过向量数据库存储和检索 |
| 上下文窗口 | Context Window | 模型一次推理能处理的最大 token 数量 |
| 持久化执行 | Durable Execution | Agent 在崩溃后可从断点自动恢复,适合长时间运行的任务 |
| 量化 | Quantization | 将模型权重从高精度(如 16-bit)压缩到低精度(如 4-bit),减少内存和加速推理 |
- LLM Agent 与工具调用:Agent 核心原理——Agent 架构、ReAct 模式、工具调用的深入讲解。
- MCP 与工具协议:标准化工具接入——Model Context Protocol 的设计理念与使用方法。
- 结构化输出:JSON Schema 约束——如何让 LLM 可靠地输出工具调用参数。
- LLM 推理:推理引擎与部署——vLLM、llama.cpp、Ollama 等推理后端的原理与选型。
- 提示工程:Prompt 设计——如何设计系统 prompt 来控制 Agent 行为。
- CrewAI 文档:docs.crewai.com——多 Agent 框架的官方教程和 API 参考。
- MetaGPT / MGX:github.com/FoundationAgents/MetaGPT——多 Agent 软件开发框架源码;mgx.dev——商业产品。
- Microsoft Agent Framework:github.com/microsoft/agent-framework——AutoGen 的企业级继任者。
- LangGraph 文档:docs.langchain.com——基于图的 Agent 编排框架,含持久化执行和 Deep Agents。
- NousResearch Hermes:huggingface.co/NousResearch——开放权重模型系列,含 Hermes 4 / 4.3 等最新版本。