游乐游手机版
首页/AI热点日报/热点详情

ICML 2026:Agent Primitives实现多智能体系统模块化复用

类型:热点整理2026-07-21
多智能体系统(MAS)在协作方面已展现出卓越能力,但当前多数系统仍为特定任务手工搭建,缺乏复用性与可迁移性。伊利诺伊大学厄巴纳-香槟分校(UIUC)DREAM Lab 团队提出了一种名为Agent Primitives 的创新思路,将多智能体系统内的协作模式抽象为可复用的基础构件,使得构建 MAS

多智能体系统(MAS)在协作方面已展现出卓越能力,但当前多数系统仍为特定任务手工搭建,缺乏复用性与可迁移性。伊利诺伊大学厄巴纳-香槟分校(UIUC)DREAM Lab 团队提出了一种名为Agent Primitives 的创新思路,将多智能体系统内的协作模式抽象为可复用的基础构件,使得构建 MAS 如同搭积木般灵活高效,大幅提升开发效率。

背景与动机

多智能体系统(Multi-Agent Systems,MAS)通过角色分工与多轮协作,能够解决单个模型难以稳定完成的数学推理、代码生成和知识问答等复杂任务。然而,这种能力背后隐藏着一个工程难题:大多数 MAS 都是围绕具体任务手工搭建的。面对新问题,研究者往往需要重新定义 Agent 角色、设计提示词、规定消息传递顺序,并不断调试协作协议。一旦更换数据集、模型甚至任务表述,原有架构就可能需要大幅调整。

这与现代深度学习的发展路径形成鲜明对比:构建卷积神经网络时,我们不会为每个视觉任务重新发明卷积;搭建 Transformer 时,也不需要从头设计注意力机制。成熟的神经网络之所以快速演进,部分原因正是研究社区找到了卷积、注意力、残差连接等可复用的基础构件。

那么,多智能体系统是否也能拥有类似的抽象形式?Agent Primitives 给出的答案是:多智能体系统也可以拥有自己的「基础模块」

从「复用 Agent」到「复用协作模式」

Agent Primitives 的出发点,是重新审视 MAS 中什么才是真正应该被复用的对象。传统方法通常把一个 Agent 视为原子单元,拥有固定身份、固定提示词和预先规定的角色,但这些角色往往与任务高度绑定,难以直接迁移到新场景。

论文观察到,尽管不同 MAS 的角色名称和流程看起来五花八门,其内部反复执行的计算模式却高度相似:有的系统让模型生成答案后进行自我审查;有的系统并行生成多个候选,再通过比较达成共识;还有的系统先把复杂目标拆解为计划,再逐步执行。因此,论文不再把 Agent 当作最小构件,而是进一步向下拆解,将这些反复出现的内部计算模式抽象为 Agent Primitives,即面向大语言模型多智能体系统的、可复用的潜在构件。

基础的 Primitives

论文实例化了三类基础 primitive,它们从现有 MAS 中提炼出三种高频、互补的计算结构。

Review Primitive:把「生成 — 批评 — 修正」变成通用循环

Review Primitive 对应多智能体系统中最常见的迭代改进模式。模型先形成一个候选解答,随后对推理漏洞、事实错误或实现缺陷进行审查,再依据反馈更新答案,可重复直至输出稳定。通过封装,系统可以在数学证明、代码调试、开放域问答等任务中复用同一种计算结构,无需为每个任务重新设计 critic 和 refiner。

Voting & Selection Primitive:在多个候选中形成共识

当一个问题存在多条合理推理路径时,单次生成容易受采样波动影响。Voting & Selection Primitive 让系统并行探索多个候选,再对这些潜在表示进行比较、聚合和选择。与传统依赖最终文本答案的投票方式不同,该 primitive 直接作用于内部潜在表示,保留了更丰富的语义和推理信息。

Planning & Execution Primitive:将高层规划与底层执行分离

复杂任务往往需要先确定做什么,再决定如何做。Planning & Execution Primitive 将高层任务分解和低层步骤执行拆开:规划阶段建立整体路线,执行阶段围绕子目标逐项完成,并把中间状态继续传递。这种分离降低了模型在长任务中同时维护全局目标与局部细节的负担,让同一个规划结构适配不同问题。

绕过自然语言瓶颈

大多数多智能体系统通过自然语言交换信息:一个 Agent 把内部思考解码成文本,另一个 Agent 再读取文本并重新编码。每经过一轮,信息都经历一次「潜在表示 — 文本 — 潜在表示」的转换,导致文本解码丢失细粒度信息、长链路交互积累噪声和误差、重复生成大量文本带来 token 开销和推理延迟。

Agent Primitives 让 primitive 内部直接通过 Key-Value Cache(KV Cache)进行潜在通信。KV Cache 原本用于保存 Transformer 已处理 token 的注意力状态,论文进一步将其作为 primitive 之间传递内部信息的载体,使后续模块能够直接继承前序计算形成的潜在状态,而不必先完整解码为自然语言。通过旋转位置编码(RoPE)的重新编码与对齐,多个 primitive 在模型内部的计算状态层面能够真正「插接」起来。

论文用实验证明了潜在通信的优势:在长上下文中注入辅助指令,当指令位于上下文中间时,自然语言通信的指令遵循率骤降至 15.6%,而 KV Cache 通信仍达到 73.3%。在通信噪声实验中,插入 10 条无关句子后,自然语言通信准确率降至 47%,而 KV Cache 通信仍保持 93%。这表明基于 KV Cache 的潜在通信能更完整地保留前序推理状态,显著降低噪声累积影响。

谁来决定如何搭这些「积木」?

有了可复用构件,下一个问题是:面对新查询,系统应该选择哪种 primitive,以什么顺序组合?论文引入了一个自动化的 LLM Organizer。Organizer 首先分析查询的性质与难点,再从 primitive 集合中挑选合适的模块并组织执行流程。例如,需要验证和修正的任务调用 Review;存在多种候选路径的问题加入 Voting & Selection;长程复杂任务先使用 Planning & Execution,再对局部结果进行审查。多个 primitive 可以串联或嵌套,形成更完整的 MAS。

Organizer 的决策由一个轻量级 Knowledge Pool 提供参考,它记录过去成功的 primitive 配置,让系统能够利用已有经验。随着成功配置的积累,构建 MAS 逐渐从「手工设计固定工作流」转变为「根据问题动态检索并组合基础构件」。

方法框图

完整框架如上图所示。Organizer 根据用户查询和 Knowledge Pool 中的历史经验选择并组合 primitives;Review、Voting and Selection、Planning and Execution 分别封装三类可复用协作模式;所有 primitive 的内部协调均通过 KV Cache 完成,并对外保留与普通 LLM Agent 一致的接口。

实验结果

论文在数学、代码和知识问答等八个基准、五种大语言模型骨干上进行了系统评估。实验关注最终准确率、token 使用、推理延迟、相对单智能体的额外开销以及跨模型骨干的稳定性。结果表明,Primitives-based MAS 在所有任务上均取得稳定提升,没有出现传统 MAS 在某些任务上提升、另一些任务上明显退化的情况。更重要的是,性能增益并非依靠无限增加 Agent 数量或生成更长的交互文本获得。综合准确率、token 消耗、推理延迟和跨模型表现,可以得出:多智能体协作并不必然意味着数倍乃至数十倍的推理成本。当协作被重新组织为潜在空间中的模块化计算后,系统可以在保留性能增益的同时,把额外成本控制在更接近单智能体推理的范围内。

走向可组合的智能系统

今天构建 MAS,仍然很像早期编写神经网络:大量能力被写死在具体架构中,每个新任务都需要重新搭建。Agent Primitives 提出了一条不同的路线——把角色背后的协作规律抽离出来,封装为潜在空间中的标准构件,再由 Organizer 根据任务动态组合。如果这种思路进一步成熟,未来开发者面对复杂任务时,或许不必先问「我需要设计几个 Agent、分别写什么 prompt」,而可以先问:「这个问题需要哪些基础计算模式,它们应该怎样连接?」从重复造轮子,到复用基础模块;从文本消息驱动的固定团队,到潜在状态连接的动态系统,这正是 Agent Primitives 希望推动的范式转变。

  • 论文标题:Agent Primitives: Reusable Latent Building Blocks for Multi-Agent Systems

  • 论文链接:https://arxiv.org/pdf/2602.03695

  • 实验室网址:https://dream.ischool.illinois.edu/

来源:https://www.jiqizhixin.com/api/article_library/articles/2026-07-21-3

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。