Multi-Agent 价值之争
多智能体到底是 +90.2% 的能力跃迁,还是一个 41.8% 死于规格设计的昂贵陷阱?答案取决于任务结构与 token 预算——双方说的是不同场景。
争议各方与证据
- 立场 A(厂商上限案例):Anthropic 内部评测称其 Research 多智能体系统相对单 Agent +90.2%。但该系统是 Orchestrator-Worker 架构,有效性”关键是花了足够多的 token”,代价是成本高、错误累积,token 消耗约为单 Agent 的 15×(Multi-Agent Research 系统)。属特定研究/检索任务 + 充裕预算下的上限案例。
- 立场 B(学术失败分类):Berkeley MAST 失败分类显示多智能体失败 41.8% 源于规格/设计(任务分解不当、角色不清)、36.9% 源于智能体间对齐、21.3% 源于验证/终止——失败大多在系统设计层而非单模型能力(Multi-Agent-Systems)。
- 立场 C(单 Agent 优先):Cognition《Don’t Build Multi-Agents》主张单 Agent + 工具优先,认为多智能体协调成本高、易失败;Claude Code 的极简主义架构(单一主循环、max-1-branch)是同一哲学的工程实践(Agent 架构)。
- 立场 D(保守中立):构建智能体实用指南 与 设计模式分析 均主张”仅当任务可清晰分解、子任务相对独立、需并行加速时才用”。
证据质量评估
四方证据可信度差异显著。A 为厂商自报、内部、单任务——+90.2% 无法外推到通用场景,且与 Anthropic 销售多智能体能力的商业利益相关。B 为学术失败分类,独立第三方、方法论透明,但样本偏向”已失败的系统”,可能高估失败率。C 为厂商/从业者自述(Cognition 卖单 Agent 产品 Devin),立场即商业模式。D 为方法论指南,立场最中立但缺乏量化对照实验。整体上 B 与 D 的可信度高于 A、C,但 B 的样本偏差需打折。
当前最佳判断
四方并不根本矛盾,而是适用边界不同。当前最站得住脚的结论:默认单 Agent + 工具,只有在任务结构天然可分解、子任务相对独立、且收益(提速/质量)大于约 15× token 与协调失败成本时,才升级为多智能体。 +90.2% 是可分解研究/编码任务 + 充裕预算下的真实上限;MAST 与 Cognition 则提醒默认场景下协调失败是主要风险源。这与跨来源的共识一致——“从最简单方案开始”(AI Agent)。
仍待解决的问题
- 缺乏同一任务上单 Agent vs 多 Agent 的成本归一化对照实验(控制 token 预算后 +90.2% 还剩多少?)。
- MAST 的 41.8% 是否被”失败系统样本偏差”放大,需对成功系统做同类标注。
- 多智能体的责任归属与可调试性在合规敏感场景如何工程化,尚无成熟方案。
关联
- Multi-Agent-Systems — 本争议的综合母题
- wiki/analyses/Token经济学-厂商收入即客户成本 — 15× token 成本正是”厂商收入=客户成本”张力的具体体现
- wiki/analyses/LLM评测-主客观分裂 — +90.2% 的评测口径同样面临实验室≠生产的问题
- wiki/topics/Agent架构 · AI-Agent · Anthropic