Multi-Agent Systems(多智能体系统)
多智能体系统(MAS)由多个专职 Agent 协作/竞争完成单个 Agent 难以胜任的复杂任务。本页综合本批次来源,梳理编排模式、失败分类与”该不该建多智能体”的核心争论——这是本批次矛盾最集中的主题。
编排模式谱系
来自 Agent 设计模式分析,控制力递减、涌现性递增:
| 模式 | 结构 | 特点 |
|---|---|---|
| Orchestrator-Workers | 中心化分派 | 主控分解任务、分派 worker、聚合结果;可控性最高 |
| Hierarchical / Supervisor | 分层监督 | 多级 supervisor,适合大型组织化任务 |
| Sequential Pipeline | 顺序流水线 | 上游产出喂下游 |
| Group Chat / Debate | 去中心化辩论 | 多 Agent 对话/辩论,涌现性高但难控 |
| Blackboard | 共享状态板 | 通过共享黑板异步协作 |
| Routing / Handoff | 路由交接 | 按任务类型交接给专家 Agent |
| Parallel / Map-Reduce | 并行聚合 | fan-out 并行 + reduce 聚合 |
MAST 失败分类(Berkeley)
多智能体失败的系统性分类(Multi-Agent System Failure Taxonomy):
| 失败类别 | 占比 |
|---|---|
| 规格 / 设计失败(任务分解不当、角色不清) | 41.8% |
| 智能体间对齐失败(通信、冲突、目标漂移) | 36.9% |
| 验证 / 终止失败(缺乏校验、错误收敛) | 21.3% |
启示:多智能体的失败大多在系统设计层面,而非单模型能力——编排质量决定成败。
核心争论:该不该建多智能体?
⚠️ 矛盾 [2026-07-25] 本批次来源在多智能体价值上立场分裂:
- 支持方:Anthropic 内部评测称多智能体研究系统 +90.2%——但属厂商内部、特定任务、约 15× token 成本。
- 反对方:Cognition《Don’t Build Multi-Agents》主张单 Agent + 工具优先,多智能体协调成本高、易失败。
- 中立/保守方:构建智能体实用指南 与 设计模式分析 均主张”仅当任务可清晰分解、子任务相对独立、需并行加速时才用”。
综合判断:三者并不根本矛盾,但适用边界不同。+90.2% 是上限案例(可分解的研究/编码任务 + 充裕 token 预算);MAST 与 Cognition 提醒默认场景下多智能体的协调失败风险。默认单 Agent,只有在任务结构天然可分解且收益大于协调成本时才升级。
多智能体评测
交互式评测报告 与 Agent 评测趋势 指出多智能体评测的特殊维度:
- MultiAgentBench / MARBLE:评估通信质量、角色分工、冲突管理、协作/竞争得分。
- 评测对象从”模型”升级为”组织化系统”——需衡量群体效率而非单点能力。
- 与单 Agent 评测相比,需额外关注通信开销、协调失败、责任归属。
与其他主题的关系
- 多智能体是 AI Agent 的进阶形态;编排能力依赖 Agent Harness 提供的运行时原语。
- Deep Research 是多智能体(orchestrator-workers)在研究场景的典型应用。