游乐游手机版
首页/AI热点日报/热点详情

Anthropic从零开始多智能体研究系统构建方法详解

类型:热点整理2026-07-19
基于Anthropic经验,多智能体系统采用Orchestrator-Worker模式,通过并行子智能体实现动态搜索与性能扩展,在评估中比单智能体性能高出90 2%。系统面临token消耗大、有状态错误累积等挑战,需结合彩虹部署与全链路追踪保障生产可靠性。

本文由 Anthropic 团队撰写,深入分享了其 多智能体(Multi-Agent)研究系统 的实践路径、设计原则,以及从原型验证到生产部署的宝贵经验。无论你是正在探索 Agentic AI 的开发者,还是希望将 AI 产品化的技术负责人,这份指南都能为你提供切实可行的路线图。

一、为什么多智能体系统是AI研究的关键选择

研究任务本质上具有 开放性与不确定性:你无法预先穷举所有步骤,过程动态且路径依赖。人类研究者会根据发现不断调整方向,这种不可预测性让 AI Agent 成为绝佳选择。

  • 动态规划能力:Agent 能够自主运行多个回合,根据中间发现决定下一步探索方向,而非线性流水线。
  • 压缩与并行:搜索的本质是从海量信息中提炼关键。Subagents 在各自的上下文窗口中并行操作,将最重要的 tokens 浓缩给主导 Agent,实现 关注点分离(separation of concerns),减少路径依赖。
  • 性能扩展:当单个模型能力达到瓶颈,多智能体系统通过协同工作获得远超个体的能力。内部评估显示,以 Claude Opus 4 为主导、Claude Sonnet 4 为 subagents 的系统,在广度优先搜索任务中性能比单个 Opus 4 高出 90.2%

关键分析:多个 Agent 并行使用 tokens 是性能提升的核心驱动力。内部因素分析表明,token 使用量解释了 BrowseComp 评估中 80% 的性能差异。多智能体架构让“算力投入”超越单个 context window 的限制。

⚠️ 重要提示:多智能体系统会快速消耗 tokens——通常比普通交互多约 15 倍。务必确认任务价值足够高,以覆盖成本。此外,强依赖共享上下文或 agents 间高度耦合的任务(如复杂编码),目前尚不理想。

二、Research 功能的架构设计详解

Anthropic 的 Research 系统采用 Orchestrator-Worker 模式:一个主导 Agent 负责规划与协调,多个并行的 subagents 各自独立搜索。

用户提交查询后,主导 Agent 分析查询、制定策略,并生成 subagents 同时探索不同方面。Subagents 充当智能过滤器,通过迭代搜索工具收集信息并返回结果,主导 Agent 最终汇编答案。

这种架构不同于传统 RAG:后者是静态检索,前者是多步动态搜索,能适应新发现并分析结果,输出更高质量的答案。

三、研究型 Agent 的 Prompt 工程与评估体系

Prompt 工程核心原则

  1. 像你的 Agent 一样思考:使用 Console 建立模拟环境,一步步观察 Agent 行为。立即发现失败模式——如过度搜索、查询冗长、选错工具。
  2. 教会 Orchestrator 委派任务:为每个 subagent 提供目标、输出格式、工具指南和任务边界。模糊指令会导致重复或空白。例如,“研究半导体短缺”太宽泛,应明确“调查 2025 年汽车芯片供应链”并指定搜索范围。
  3. 根据查询复杂度调整投入:在 Prompt 中嵌入扩展规则——简单事实查找用 1 个 agent、3-10 次工具调用;复杂研究可用 10+ 个 subagents,明确划分责任。这防止了早期常见的“大题小作”或“小题大做”。
  4. Tool 设计和选择至关重要:你给 Agent 的工具接口如同人与机器的交互界面。不好的描述会让 Agent 选错工具。每个工具都需清晰的目的与描述,并给出启发式规则(如“首先检查所有可用工具”)。
  5. 让 Agent 自我改进:Claude 4 模型能诊断自身失败原因并改进 Prompt。使用“工具测试 Agent”自动重写有缺陷的 MCP 工具描述,任务完成时间可减少 40%。
  6. 从广泛开始,再逐步收窄:模拟专家人类研究:先简短宽泛查询,评估信息后再聚焦。避免默认使用过长、过于具体的查询。
  7. 引导思考过程:利用 extended thinking 模式让主导 Agent 规划方法、分配角色。Subagents 使用 interlea ved thinking 评估质量并优化下一次查询。
  8. 并行 Tool 调用改变速度:主导 Agent 并行启动 3-5 个 subagents,subagent 内部并行使用 3 个以上工具。复杂查询的研究时间可缩短高达 90%。

Agent 评估方法论

立即用小样本开始:从约 20 个真实使用案例开始,早期变化效果显著。不要等几百个测试用例再评估。

LLM-as-judge 可以很好地扩展:使用单一 LLM 评委按评分标准(事实准确性、引用质量、完整性等)打出 0.0-1.0 分数。单个 prompt 输出分数加通过/失败等级,较多人评委更一致。

人工评估不可替代:人工测试能发现自动化评估遗漏的边缘情况,如幻觉、来源偏见(例如早期 Agent 偏爱 SEO 内容农场)。人机结合效果最佳。

来源:https://www.53ai.com/news/LargeLanguageModel/2025072727109.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。