Deep Research(深度研究系统)

Deep Research 是多智能体编排(orchestrator-workers)在研究场景的典型应用:Lead Agent 分解研究问题、并行 fan-out 多个子 Agent 从不同角度检索/抓取、独立验证 Agent 对 claim 做交叉核验,最终聚合为带引用的报告。本页综合本批次来源的研究相关模式,并衔接 wiki 既有的 Claude Deep Research 架构。


架构模式:Orchestrator-Workers + 对抗式验证

Deep Research 是 Multi-Agent-Systems 中 orchestrator-workers 模式的具体化(设计模式分析实用指南):

Lead Agent(分解问题)
   ├─→ 子 Agent A(角度 1:检索 + 抓取)
   ├─→ 子 Agent B(角度 2:检索 + 抓取)   ← 并行 fan-out
   └─→ 子 Agent C(角度 N:...)
          ↓
   验证 Agent(cross-check / survival vote,多源一致性筛弱结论)
          ↓
   聚合 → 带引用的研究报告

Claude 的实现(衔接 wiki 既有 Claude Deep Research Architecture):

  • Claude.ai Research:Lead Agent 动态调度 + Citation Agent。
  • Claude Code /deep-research:偏”代码化编排”——先写 workflow script,后台 runtime 管循环/分支/状态,状态外置不挤主上下文,支持大规模 fan-out 与对抗式验证,/workflows 可观测。

为什么 Deep Research 是多智能体的”好场景”

研究任务天然满足多智能体的适用条件(实用指南):

  • 可清晰分解:一个研究问题可拆为多个独立检索角度。
  • 子任务相对独立:各角度检索互不依赖,适合并行加速。
  • 需对抗式验证:独立 Agent 交叉核验提升结论可靠性,呼应 成对评测 的 claim 核验思想。

这正是 Anthropic 多智能体研究系统取得 +90.2% 的场景类型(注意:厂商内部、约 15× token 成本,见 Multi-Agent-Systems 矛盾标记)。


评测视角:科研复现与长程任务

交互式评测报告 把”科研复现与长程任务”列为前沿方向:PaperBench(复现 ICML 2024 论文,20 篇 / 8316 子任务)考察长程自主执行能力。Deep Research 类系统的评测需关注引用支持度、多源一致性、长程稳定性,而非单点答案正确率(见 LLM 评估)。


引用可溯源

Deep Research 的可信度核心在引用可溯源:每个 claim 须挂靠可核验来源,与 联网搜索评测 的 citation support rate / hallucination rate 指标体系一致。


矛盾或新想法

本批次来源中,文件名含 “deep-research” 的两份(deep-research-report.md 实为 LLM-HTML 生成设计文档、skills-deep-research-report.md 实为 Skills 分类研究)并非真正讨论 Deep Research 系统——命名与内容不符。本主题页主要综合多智能体编排来源 + wiki 既有 Claude Deep Research 架构,直接的 Deep Research 一手来源在本批次较稀缺,建议后续补充专门的 Deep Research 来源。