Multi-Agent 价值之争

多智能体到底是 +90.2% 的能力跃迁,还是一个 41.8% 死于规格设计的昂贵陷阱?答案取决于任务结构与 token 预算——双方说的是不同场景。

争议各方与证据

  • 立场 A(厂商上限案例):Anthropic 内部评测称其 Research 多智能体系统相对单 Agent +90.2%。但该系统是 Orchestrator-Worker 架构,有效性”关键是花了足够多的 token”,代价是成本高、错误累积,token 消耗约为单 Agent 的 15×Multi-Agent Research 系统)。属特定研究/检索任务 + 充裕预算下的上限案例。
  • 立场 B(学术失败分类):Berkeley MAST 失败分类显示多智能体失败 41.8% 源于规格/设计(任务分解不当、角色不清)、36.9% 源于智能体间对齐、21.3% 源于验证/终止——失败大多在系统设计层而非单模型能力(Multi-Agent-Systems)。
  • 立场 C(单 Agent 优先):Cognition《Don’t Build Multi-Agents》主张单 Agent + 工具优先,认为多智能体协调成本高、易失败;Claude Code 的极简主义架构(单一主循环、max-1-branch)是同一哲学的工程实践(Agent 架构)。
  • 立场 D(保守中立)构建智能体实用指南设计模式分析 均主张”仅当任务可清晰分解、子任务相对独立、需并行加速时才用”。

证据质量评估

四方证据可信度差异显著。A 为厂商自报、内部、单任务——+90.2% 无法外推到通用场景,且与 Anthropic 销售多智能体能力的商业利益相关。B 为学术失败分类,独立第三方、方法论透明,但样本偏向”已失败的系统”,可能高估失败率。C 为厂商/从业者自述(Cognition 卖单 Agent 产品 Devin),立场即商业模式。D 为方法论指南,立场最中立但缺乏量化对照实验。整体上 B 与 D 的可信度高于 A、C,但 B 的样本偏差需打折。

当前最佳判断

四方并不根本矛盾,而是适用边界不同。当前最站得住脚的结论:默认单 Agent + 工具,只有在任务结构天然可分解、子任务相对独立、且收益(提速/质量)大于约 15× token 与协调失败成本时,才升级为多智能体。 +90.2% 是可分解研究/编码任务 + 充裕预算下的真实上限;MAST 与 Cognition 则提醒默认场景下协调失败是主要风险源。这与跨来源的共识一致——“从最简单方案开始”(AI Agent)。

仍待解决的问题

  • 缺乏同一任务上单 Agent vs 多 Agent 的成本归一化对照实验(控制 token 预算后 +90.2% 还剩多少?)。
  • MAST 的 41.8% 是否被”失败系统样本偏差”放大,需对成功系统做同类标注。
  • 多智能体的责任归属与可调试性在合规敏感场景如何工程化,尚无成熟方案。

关联