Multi-Agent Systems(多智能体系统)

多智能体系统(MAS)由多个专职 Agent 协作/竞争完成单个 Agent 难以胜任的复杂任务。本页综合本批次来源,梳理编排模式、失败分类与”该不该建多智能体”的核心争论——这是本批次矛盾最集中的主题。


编排模式谱系

来自 Agent 设计模式分析,控制力递减、涌现性递增:

模式结构特点
Orchestrator-Workers中心化分派主控分解任务、分派 worker、聚合结果;可控性最高
Hierarchical / Supervisor分层监督多级 supervisor,适合大型组织化任务
Sequential Pipeline顺序流水线上游产出喂下游
Group Chat / Debate去中心化辩论多 Agent 对话/辩论,涌现性高但难控
Blackboard共享状态板通过共享黑板异步协作
Routing / Handoff路由交接按任务类型交接给专家 Agent
Parallel / Map-Reduce并行聚合fan-out 并行 + reduce 聚合

MAST 失败分类(Berkeley)

多智能体失败的系统性分类(Multi-Agent System Failure Taxonomy):

失败类别占比
规格 / 设计失败(任务分解不当、角色不清)41.8%
智能体间对齐失败(通信、冲突、目标漂移)36.9%
验证 / 终止失败(缺乏校验、错误收敛)21.3%

启示:多智能体的失败大多在系统设计层面,而非单模型能力——编排质量决定成败。


核心争论:该不该建多智能体?

⚠️ 矛盾 [2026-07-25] 本批次来源在多智能体价值上立场分裂:

  • 支持方:Anthropic 内部评测称多智能体研究系统 +90.2%——但属厂商内部、特定任务、约 15× token 成本
  • 反对方:Cognition《Don’t Build Multi-Agents》主张单 Agent + 工具优先,多智能体协调成本高、易失败。
  • 中立/保守方构建智能体实用指南设计模式分析 均主张”仅当任务可清晰分解、子任务相对独立、需并行加速时才用”。

综合判断:三者并不根本矛盾,但适用边界不同。+90.2% 是上限案例(可分解的研究/编码任务 + 充裕 token 预算);MAST 与 Cognition 提醒默认场景下多智能体的协调失败风险。默认单 Agent,只有在任务结构天然可分解且收益大于协调成本时才升级。


多智能体评测

交互式评测报告Agent 评测趋势 指出多智能体评测的特殊维度:

  • MultiAgentBench / MARBLE:评估通信质量、角色分工、冲突管理、协作/竞争得分。
  • 评测对象从”模型”升级为”组织化系统”——需衡量群体效率而非单点能力。
  • 与单 Agent 评测相比,需额外关注通信开销、协调失败、责任归属

与其他主题的关系

  • 多智能体是 AI Agent 的进阶形态;编排能力依赖 Agent Harness 提供的运行时原语。
  • Deep Research 是多智能体(orchestrator-workers)在研究场景的典型应用。