游乐游手机版
首页/AI热点日报/热点详情

Anthropic多智能体研究系统构建方法

类型:热点整理2026-07-21
Anthropic构建的多智能体研究系统采用编排者-工作者模式,以ClaudeOpus4为主智能体规划研究,ClaudeSonnet4为子智能体并行搜索,性能较单智能体提升90 2%。系统支持动态搜索、扩展思维与交错思维,通过提示工程和工具设计优化协调,但Token消耗约为普通交互的15倍,目前适用于高价值研究任务。

Anthropic近期在其官网发布了一篇深度技术文章,详细阐述了如何构建多智能体研究系统(Multi-Agent Research System)。文中涵盖了智能体编排(Orchestration)、子智能体(Subagent)等核心概念,读后令人受益匪浅。有趣的是,若将这篇文章与OpenAI不久前推出的GPT-5对照来看,会发现两者之间存在一种巧妙的呼应——没错,即便GPT-5官方也宣称其内置了一个“自动路由器”。

GPT-5本质上并非一个单一的大模型,更像是一个多智能体系统。从《GPT-5 System Card》的描述来看:它被设计为一个统一系统,包含一个快速智能模型用于回答大多数问题、一个深度推理模型,以及一个实时路由器——后者会根据对话类型、问题复杂度、工具需求以及显式意图(例如用户说“仔细考虑一下”)来决定调用哪个模型。这个路由器持续在真实信号上训练,包括用户切换模型的时间点、响应偏好率以及正确性指标。一旦达到使用限制,每个模型的迷你版本还会接手剩余查询。未来,这些功能将整合到一个模型中。这是一个很有启发性的设计思路。

言归正传,以下是我阅读Anthropic那篇文章后整理的摘录和总结。正在研究或计划搭建多智能体系统的同学,不妨一起探讨交流。

1. 什么是多智能体研究系统

所谓多智能体研究系统,就是让多个智能体(即大语言模型在循环中自主使用工具)协同工作,共同完成研究任务。在Anthropic的具体实现中,一个主智能体根据用户查询规划研究过程,然后通过工具创建多个并行搜索信息的子智能体。这种架构在智能体协调、评估和可靠性方面带来了全新挑战。核心在于,研究任务往往是开放式的、难以预先确定步骤,具有极强的动态性和路径依赖性。单一的智能体受限于上下文窗口和顺序处理能力,很难高效应对这类复杂查询。

2. 多智能体系统的优势

首先,研究类工作面对的大多是开放式问题,事先很难预见所有必需步骤。你无法对探索复杂主题的固定路径进行硬编码,因为整个过程本质上是动态的、路径依赖的。人类做研究时,会不断根据新发现调整策略,追踪调查过程中涌现的新线索。随着调查深入,研究需要灵活调整方向,甚至探索一些“题外”的联系。模型必须自主运行多个回合,根据中间发现决定下一步往哪走。传统的线性一次性管道根本应付不了这种任务——而这正是AI智能体发挥优势的地方。

本质上,搜索就是压缩——从庞大的语料库中提炼出有价值的见解。子智能体通过并行操作各自的上下文窗口,在主智能体凝聚关键信息之前,同时探索问题的不同方面,从而加速这一压缩过程。每个子智能体还提供了关注点分离(使用不同的工具、提示词和探索轨迹),降低了路径依赖性,确保更彻底、更独立的调查。一旦智能体数量达到一定阈值,多智能体系统就成为扩展性能的重要手段。一个类比:虽然个体的智慧在过去十万年间增长有限,但依靠集体智慧和协调能力,人类社会在信息时代的能力呈现指数级增长。在Anthropic的内部评估中,以Claude Opus 4为主智能体、Claude Sonnet 4为子智能体的多智能体系统,性能比单智能体Claude Opus 4高出90.2%。这个数字相当惊人。

3. 多智能体系统的劣势

当然,任何架构都有代价。在实践中,多智能体系统会快速消耗Token。数据显示,智能体通常比普通聊天交互多用约4倍的Token,而多智能体系统更是达到15倍左右。此外,有些领域根本不适用——比如要求所有智能体共享相同上下文,或者涉及智能体之间大量依赖关系的任务。编码任务就是个典型例子,它真正可并行的部分远少于研究,而且当前的LLM智能体还不擅长实时协调和任务委派。从Anthropic的实践来看,多智能体系统最擅长处理那些需要大量并行化、信息量超出单个上下文窗口、且涉及众多复杂工具交互的任务。

4. 系统架构:编排者-工作者模式

核心设计

系统采用“编排者-工作者”(Orchestrator-Worker)模式:

  • 领导智能体(Lead Agent):使用Claude Opus 4,负责分析用户查询、制定研究策略,并生成专门的子智能体(通常为Claude Sonnet 4)并行探索查询的不同方面。
  • 子智能体(Subagents):每个子智能体拥有独立的上下文窗口,专注于特定子任务(如搜索、数据分析),结果返回给领导智能体进行整合。
  • 引用智能体(CitationAgent):专门处理信息归属,确保所有声明都可追溯到来源,提升研究可信度。

动态搜索方面,与传统RAG(检索增强生成)不同,这个系统支持动态调整研究路径,根据新发现迭代优化,而非依赖静态数据检索。

扩展思维与交错思维

  • 扩展思维(Extended Thinking):指Claude在生成回答前,通过更长时间的内部推理过程来分析问题,逐步分解复杂任务、探索多种可能性、整合信息,最终生成更准确全面的回答。就像人类面对复杂问题时进行的“深度思考”。
  • 交错思维(Interleaved Thinking):指Claude在生成回答的过程中,将推理步骤与输出内容交织在一起,边思考边生成答案。更接近“边说边想”的对话模式,允许模型在输出过程中动态调整推理方向。

5. 关键技术与挑战

提示工程(Prompt Engineering)

  • 智能体思维模拟:通过模拟智能体行为来优化提示,解决生成过多子智能体或重复搜索等问题。
  • 任务分解与协调:领导智能体需提供明确的子任务描述,包括目标、输出格式和工具使用指导,避免工作重叠或遗漏。
  • 努力程度匹配:通过嵌入缩放规则,系统根据查询复杂性动态分配资源。简单事实查询用1个智能体3-10次工具调用,复杂研究可能用到10个以上子智能体。

工具设计

工具(如网页搜索、API调用)需清晰定义用途和接口,智能体通过启发式规则选择合适工具。Anthropic甚至使用Claude模型来优化工具描述,最终将任务完成时间降低了40%。

计算成本

多智能体系统消耗大量Token——约是普通聊天交互的15倍。因此,目前只适合高价值任务,确保经济可行性。

6. 评估与生产部署

评估方法

  • 小样本测试:早期开发中,20个代表性查询就能发现显著改进。
  • LLM-as-Judge:使用大型语言模型基于准确性、引用质量、完整性等标准评分。
  • 人工评估:捕捉自动化评估容易遗漏的边缘情况,比如对SEO优化内容的过度依赖。

生产挑战

  • 状态管理:智能体运行多轮,需通过内存系统(如Redis)保存上下文,防止超过200,000 Token限制时丢失信息。
  • 错误恢复:系统支持从错误点恢复,而非从头开始,结合了重试逻辑和检查点机制。
  • 调试与观测:通过生产跟踪和智能体决策模式监控,解决非确定性行为带来的调试难题。
  • 渐进部署:采用“彩虹部署”逐步更新,避免中断运行中的智能体会话。

7. 经验教训与未来展望

经验教训

  • 多智能体系统适合需要并行探索、大量上下文和复杂工具交互的任务(如研究),但不适合高度依赖上下文共享的任务(如编码)。
  • 提示工程和工具设计,与模型选择同等重要,需要精确协调以避免低效或错误。
  • 人类监督与自动化评估相结合,才是确保系统可靠性的关键。

未来方向

Anthropic计划探索异步执行,以进一步提升并行效率,但这需要解决更复杂的协调和状态管理问题。

8. 总结

Anthropic的多智能体研究系统,通过主智能体与子智能体的协作,成功突破了单智能体在复杂研究任务中的瓶颈。其成功依赖于精心设计的架构、提示工程、工具集成和评估策略。虽然高计算成本限制了它的适用范围(目前更适合高价值任务),但文章为开发类似系统提供了宝贵经验——尤其是协调、动态适应和可靠性这三个维度,在多智能体AI中至关重要。

来源:https://www.53ai.com/news/LargeLanguageModel/2025081549358.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。