Multi-Agent System—— 多智能体系统 - Clear Eyes, Full Heart
LOADING
4301 words
22 minutes
Multi-Agent System—— 多智能体系统

Multi-Agent System—— 多智能体系统

引言:从“超级个体”到“专家团队”

在前面几篇文章中,我们讨论了一个Agent如何思考、如何调用工具、如何记忆、如何与其他Agent通信。然而,单个Agent的能力终究是有限的——无论模型多么强大,单一智能体在处理复杂任务时都会遇到瓶颈。

Anthropic的研究数据表明,当单个智能体挂载超过10-15个工具后,性能就会出现断崖式下跌。而企业级系统动辄需要上百个功能接口,单Agent架构根本撑不住。更不用说,当任务涉及多个专业领域、需要并行处理大量信息时,单Agent的局限性更加明显。

多智能体系统(Multi-Agent System, MAS) 正是为此而生。它不是简单地把多个LLM堆在一起,而是一种分布式自主决策系统。想象一个急诊室:分诊护士、主治医生、检验师、药剂师各自专业,通过标准化流程协作救人。

本文将系统讲解多Agent协作的核心理念、三大协作模式、决策协议机制,以及多智能体辩论(MAD)和Mixture-of-Agents(MoA)两大前沿技术。


一、核心理念——为什么需要多Agent

1.1 单Agent的极限

在深入多Agent之前,有必要先理解单Agent为什么会在复杂任务面前失效。核心原因有两个:

指令迷雾(Instruction Fog) :当提示词越来越长、任务越来越复杂时,模型开始“丢指令”——早期给出的约束条件被遗忘,关键规则被忽略。

工具过载(Tool Overload) :当可选工具太多时,模型的选择准确率急剧下降。一个原本在5个工具上表现完美的Agent,在50个工具面前可能变成一个“选择困难症患者”。

1.2 多Agent的核心逻辑

多智能体系统的核心理念可以用一句话概括:通过角色分工和协作,将复杂任务分解为多个专业Agent各自擅长的子任务

从数学角度看,多Agent系统将一个复杂的目标函数 GG 分解为多个子目标,由不同专业Agent分别求解:

G=i=1ngi,其中Agenti负责求解 giG = \bigcup_{i=1}^{n} g_i, \quad \text{其中Agent}_i \text{负责求解 } g_i

每个Agent ii 在自己的专业领域内求解:

ai=argmaxaPi(acontexti)a_i^* = \arg\max_{a} P_i(a \mid \text{context}_i)

最终的全局解是所有Agent输出的聚合组合

A=Aggregate(a1,a2,...,an)A^* = \text{Aggregate}(a_1^*, a_2^*, ..., a_n^*)

多Agent架构的核心优势在于分工协作。正如一篇2025年的综述所指出的,基于LLM的多智能体系统使一群智能Agent能够协同解决复杂任务,实现了从孤立模型到以协作为中心的范式的转变。

1.3 关键组件分层

一个成熟的多Agent系统包含四个关键层次:

  • Agent运行时(Agent Runtime) :每个Agent的独立沙箱,包含LLM、工具集、记忆体
  • 通信总线(Communication Bus) :标准化消息格式、信道加密与路由
  • 编排引擎(Orchestration Engine) :任务分解、Agent分配、结果聚合
  • 观察者(Observer) :监控Agent状态、检测死锁、触发熔断

二、三大协作模式

根据决策的集中化程度和通信方式,多Agent协作可以归纳为三种基本模式。

2.1 模式一:顺序流水线接力(Sequential Pipeline)

核心思想:Agent串联排列,A处理完传给B,B处理完传给C。

这是最简单的多Agent协作模式,类似于工厂流水线——一个人装车门,下一个人喷漆。在LLM-based MAS中,专门化的Agent按照预定义顺序协作,分别扮演规划、开发、测试等角色。

数学建模:顺序流水线可以形式化为一个函数复合:

y=fnfn1...f1(x)y = f_n \circ f_{n-1} \circ ... \circ f_1(x)

其中 fif_i 是第 ii 个Agent的转换函数,xx 是输入,yy 是最终输出。

优缺点

  • 优点:可预测性高、调试方便——链条断在哪一眼就能看出来
  • 缺点:完全没有弹性——下游Agent发现上游出错了也无法退回重做

典型应用:博客生成流水线——研究员Agent找素材 → 写作Agent出草稿 → 编辑Agent审校;SQL生成流水线——SQL生成器 → SQL评分器。

2.2 模式二:层级委托(Hierarchical Leader-Worker)

核心思想:顶层有一个“经理”Agent(Supervisor/Leader),不干具体活儿,只负责拆解任务、分配给下面的“工人”Agent。

层级架构通过顶层规划器将子任务委托给工作Agent,提高了可靠性。在这种架构中,Agent被分为领导者和追随者——领导者执行计算密集型的规划和控制,追随者使用轻量级规则跟踪各自的领导者。

数学建模:设经理Agent的策略为 πmanager\pi_{\text{manager}},它将目标 GG 分解为子任务 (g1,...,gn)(g_1, ..., g_n) 并分配给工人Agent:

(g1,...,gn)πmanager(G)(g_1, ..., g_n) \sim \pi_{\text{manager}}(G)

每个工人Agent ii 独立求解:

ai=argmaxaPi(agi)a_i = \arg\max_{a} P_i(a \mid g_i)

经理Agent负责聚合结果:

A=Aggregate(a1,...,an)A = \text{Aggregate}(a_1, ..., a_n)

优缺点

  • 优点:能应对复杂多变的目标,分工清晰
  • 缺点:经理Agent是单点故障——经理判断错了,整个团队跟着错

典型应用:旅行规划器——经理Agent调度机票专家、酒店专家、本地游专家协同生成行程。

2.3 模式三:对等协商(Peer-to-Peer Negotiation)

核心思想:所有Agent处于同一层级,通过点对点消息传递进行动态协商。

在对等架构中,Agent之间没有明确的上下级关系,而是通过去中心化的协商达成共识。A2A协议正是这种模式的典型代表——它被业界描述为“缺失的对等层,将孤立的bot转变为协作的多Agent系统”。

数学建模:对等协商可以建模为一个分布式约束满足问题。每个Agent ii 有自己的局部目标 gig_i 和行动空间 Ai\mathcal{A}_i。协商过程通过多轮消息传递,逐步缩小分歧:

ai(t+1)=argmaxaAiPi(amessages from other agents at round t)a_i^{(t+1)} = \arg\max_{a \in \mathcal{A}_i} P_i(a \mid \text{messages from other agents at round } t)

最终通过共识投票达成集体决策。

优缺点

  • 优点:无单点故障、弹性扩展能力强、适应动态环境
  • 缺点:决策延迟高(需要达成共识)、调试困难(分布式追踪)

典型应用:动态环境下的任务分配、去中心化的多Agent协作网络。

2.4 三种模式的对比

维度顺序流水线层级委托对等协商
决策集中度最高(固定顺序)中(经理决策)最低(分布式)
通信方式单向传递上下级指令点对点消息
决策延迟低-中高(需共识)
容错能力差(单点断链)中(经理单点)高(无单点)
适用场景流程固定、时效敏感复杂目标、需分工动态环境、弹性扩展
代表框架顺序编排器CrewAIAutoGen v0.4+

三、决策协议——从“讨论”到“决定”

协作模式的差异决定了Agent之间“怎么聊”,而决策协议(Decision Protocol) 决定了“聊完之后怎么办”——多个Agent产生了不同的意见,如何形成一个最终的、一致的决策?

这是多Agent系统中最关键的环节之一。2025年ACL的一篇系统研究评估了七种决策协议对多Agent辩论的影响,揭示了不同协议在不同任务类型上的表现差异。

3.1 协议一:投票(Voting)

核心思想:每个Agent独立给出答案或偏好,通过多数原则(如超过50%)形成最终决策。

在数学上,投票可以表示为:

A=argmaxai=1nwi1[ai=a]A^* = \arg\max_{a} \sum_{i=1}^{n} w_i \cdot \mathbb{1}[a_i = a]

其中 wiw_i 是Agent ii 的投票权重(可以基于历史准确率动态调整),1[]\mathbb{1}[\cdot] 是指示函数。

表现数据:投票协议在推理任务上表现优异,相比其他决策协议提升了13.2% 的性能。

适用场景:逻辑推理、数学问题、代码生成等“有明确正确答案”的任务。

3.2 协议二:共识(Consensus)

核心思想:所有Agent通过多轮讨论和协商,达成一致同意的决策。

共识协议更强调集体讨论和互动,通过多轮审议让所有Agent的意见趋于一致。与投票不同,共识不满足于“多数同意”,而是追求“全体同意”或“近乎全体同意”。

表现数据:共识协议在知识任务上表现更好,相比其他决策协议提升了2.8%

适用场景:知识密集型任务、需要综合多方意见的开放性问答题。

3.3 协议三:法官裁决(Judge / Adjudicator)

核心思想:引入一个独立的“法官”Agent(或人类),听取各方辩论后做出最终裁决。

法官裁决借鉴了司法审判的流程——多个Agent扮演不同角色(如控方、辩方、专家证人),通过辩论呈现各自的论据,法官基于这些论据做出最终判断。

数学建模:设法官的策略为 πjudge\pi_{\text{judge}},其输入是所有Agent的论据 {a1,...,an}\{a_1, ..., a_n\} 和辩论历史 HH

Aπjudge(a1,...,an,H)A^* \sim \pi_{\text{judge}}(a_1, ..., a_n, H)

适用场景:高 stakes 决策(如法律判断、医疗诊断)、需要“第三方仲裁”的争议场景。

3.4 协议选择指南:任务适配性

决策协议最佳任务类型表现提升关键特征
投票推理任务+13.2%快速、适合有明确答案的问题
共识知识任务+2.8%适合需要综合多方知识的开放问题
法官裁决争议性决策视情况适合高 stakes、需要仲裁的场景

值得特别注意的是,增加Agent数量通常会提升性能,但增加讨论轮次反而可能降低性能。这意味着在多Agent辩论中,“聊太久”可能适得其反——更多的讨论不一定会带来更好的决策。


四、多智能体辩论(MAD)——当Agent开始“吵架”

4.1 什么是MAD

多智能体辩论(Multi-Agent Debate, MAD) 是一种让多个Agent通过结构化的“针锋相对”式辩论来共同求解问题的框架。多个Agent各自提出论点、反驳对方、修正自己的立场,通过多轮交互逐步逼近正确答案。

MAD的核心假设是:辩论过程本身能够提升集体智能——通过思想的碰撞和交锋,Agent能够发现自己推理中的盲点,从而得出更可靠的结论。

4.2 MAD的数学建模

MAD可以形式化为一个多轮交互过程。设共有 nn 个Agent,在第 tt 轮,Agent ii 的输出为:

ai(t)=LLMi(prompt,a1(t1),...,an(t1))a_i^{(t)} = \text{LLM}_i(\text{prompt}, a_1^{(t-1)}, ..., a_n^{(t-1)})

即每个Agent在每一轮都能看到其他Agent上一轮的观点,并据此调整自己的立场。

经过 TT 轮辩论后,通过决策协议(通常是多数投票)得出最终答案:

A=Vote(a1(T),...,an(T))A^* = \text{Vote}(a_1^{(T)}, ..., a_n^{(T)})

4.3 MAD的真实效果:一个颠覆性的发现

然而,2025年NeurIPS的一篇重要研究对MAD的有效性提出了根本性质疑

研究者将MAD拆解为两个核心组件——多数投票Agent间辩论——分别评估它们的贡献。结果令人惊讶:多数投票单独就能解释MAD的大部分性能提升,而辩论本身并没有显著提升预期的正确性。

更深入的理论分析表明,辩论过程可以建模为一个随机过程,它诱导了Agent信念轨迹上的鞅(Martingale) ,这意味着辩论本身并不会改善预期的正确性。

简单来说:让一群Agent各自独立回答问题然后投票,效果并不比让它们先吵一架再投票差——甚至可能更好。

另一项2025年的研究也得出了类似的结论:多数投票在多数情况下是最佳策略。研究者甚至提出了一个更尖锐的问题:“如果多Agent辩论是答案,那么问题是什么?”

4.4 对实践的启示

这些发现并不意味着MAD没有价值,而是提示我们:

  1. 投票是核心:在多Agent系统中,多数投票是最简单、最可靠的决策机制
  2. 辩论要适度:过多的讨论轮次不仅增加成本,还可能降低性能
  3. 模型多样性很重要:有研究表明,模型异质性可以显著提升MAD框架的效果
  4. 简单集成往往更可靠:在大多数实际场景中,简单的集成方法比复杂的辩论框架更可靠

五、Mixture-of-Agents(MoA)——让多个模型“投票”

5.1 从Mixture-of-Experts到Mixture-of-Agents

Mixture-of-Agents(MoA)混合专家(Mixture-of-Experts) 范式的启发,是一种通过聚合多个不同LLM的输出来提升整体性能的集成方法。

与MAD强调“辩论”不同,MoA更强调 “多样性集成” ——让多个不同的模型(或同一模型的不同配置)各自生成答案,然后通过一个聚合器整合出最终结果。

5.2 MoA的架构

一个典型的MoA系统包含两层结构:

第一层(提案层) :多个不同的LLM(如GPT-4、Claude、Llama等)各自独立生成答案。这些模型可以是:

  • 不同供应商的模型
  • 同一模型的不同温度采样
  • 不同微调版本的模型

第二层(聚合层) :一个“聚合器”模型接收所有提案,综合生成最终答案。

数学上,MoA可以表示为:

proposals={LLMi(prompt)}i=1n\text{proposals} = \{ \text{LLM}_i(\text{prompt}) \}_{i=1}^{n}

A=Aggregator(prompt,proposals)A^* = \text{Aggregator}(\text{prompt}, \text{proposals})

5.3 MoA的效果数据

MoA的效果令人印象深刻。在一项医疗问答摘要任务中:

  • 2层MoA配置将LLaMA的性能提升了28% (从0.28到0.51)
  • 对于基于视角的摘要任务,2层MoA将LLaMA性能提升了32% (从0.28到0.37)

2025年ACL上提出的残差MoA(RMoA) 进一步优化了这一范式,受ResNet残差学习的启发,集成了残差连接来优化效率和可靠性,在数学推理、代码生成和多任务理解等多个基准上达到了SOTA性能,同时显著降低了计算开销。

5.4 MoA vs MAD:两种集成哲学的对比

维度MAD(多智能体辩论)MoA(混合智能体)
核心机制多轮辩论 + 投票多模型独立生成 + 聚合
Agent间交互强(多轮相互影响)弱(独立生成,仅最后聚合)
计算成本高(多轮)中(单轮 + 聚合)
主要驱动力辩论过程模型多样性
理论基础辩论提升推理集成提升鲁棒性
关键发现辩论本身贡献有限多样性是关键

一个值得注意的发现是:用同一顶级模型多次采样(不同温度)可能比混合不同模型效果更好。Self-MoA方法显示,单个模型多次采样比标准MoA提升了6.6% 。这说明,多样性比“不同供应商”更重要——即使是同一个模型,不同的随机种子也能带来有价值的多样性。


六、总结:多Agent协作的决策树

多Agent协作的本质,是在分工集成两个维度上做设计选择。

在分工维度(怎么组织Agent):

  • 任务线性、步骤固定 → 顺序流水线
  • 任务复杂、需专业分工 → 层级委托
  • 任务动态、需弹性扩展 → 对等协商

在集成维度(怎么形成最终决策):

  • 有明确正确答案 → 投票(推理任务提升13.2%)
  • 需综合多方知识 → 共识(知识任务提升2.8%)
  • 高 stakes 需仲裁 → 法官裁决

在实现方式维度(怎么让多个Agent协作):

  • 强调辩论交互 → MAD(但注意辩论本身贡献有限)
  • 强调模型多样性 → MoA(多样性是关键,2层可提升28%+)

这三个维度的组合,构成了多Agent系统设计的决策空间。正如一篇2025年的综述所总结的:基于LLM的多智能体系统使智能Agent群体能够协同解决复杂任务,实现了从孤立模型到以协作为中心的范式的转变。而多Agent协作本质上是一种更高级的 “上下文工程” ——通过任务分解和角色分工,巧妙地绕过了当前大模型的技术瓶颈。

在实际落地中,从简单开始——先用投票式的多数集成,再根据任务复杂度逐步引入分工和辩论。正如NeurIPS 2025那篇论文的结论所提醒的:“简单的集成方法在大多数实际场景中仍然是更强大、更可靠的选择”。

Multi-Agent System—— 多智能体系统
/posts/ai_agent/multi_agent_system/
Author
Zhang Haoyi
Published at
2026-03-16
License
CC BY-NC-SA 4.0
分享:

Some information may be outdated

Directory
Albums
Diary
Posts
Projects
Skills
Timeline
Categories
Tags
Table of Contents