Deep Research(深度研究系统)
Deep Research 是多智能体编排(orchestrator-workers)在研究场景的典型应用:Lead Agent 分解研究问题、并行 fan-out 多个子 Agent 从不同角度检索/抓取、独立验证 Agent 对 claim 做交叉核验,最终聚合为带引用的报告。本页综合本批次来源的研究相关模式,并衔接 wiki 既有的 Claude Deep Research 架构。
架构模式:Orchestrator-Workers + 对抗式验证
Deep Research 是 Multi-Agent-Systems 中 orchestrator-workers 模式的具体化(设计模式分析、实用指南):
Lead Agent(分解问题)
├─→ 子 Agent A(角度 1:检索 + 抓取)
├─→ 子 Agent B(角度 2:检索 + 抓取) ← 并行 fan-out
└─→ 子 Agent C(角度 N:...)
↓
验证 Agent(cross-check / survival vote,多源一致性筛弱结论)
↓
聚合 → 带引用的研究报告
Claude 的实现(衔接 wiki 既有 Claude Deep Research Architecture):
- Claude.ai Research:Lead Agent 动态调度 + Citation Agent。
- Claude Code
/deep-research:偏”代码化编排”——先写 workflow script,后台 runtime 管循环/分支/状态,状态外置不挤主上下文,支持大规模 fan-out 与对抗式验证,/workflows可观测。
为什么 Deep Research 是多智能体的”好场景”
研究任务天然满足多智能体的适用条件(实用指南):
- 可清晰分解:一个研究问题可拆为多个独立检索角度。
- 子任务相对独立:各角度检索互不依赖,适合并行加速。
- 需对抗式验证:独立 Agent 交叉核验提升结论可靠性,呼应 成对评测 的 claim 核验思想。
这正是 Anthropic 多智能体研究系统取得 +90.2% 的场景类型(注意:厂商内部、约 15× token 成本,见 Multi-Agent-Systems 矛盾标记)。
评测视角:科研复现与长程任务
交互式评测报告 把”科研复现与长程任务”列为前沿方向:PaperBench(复现 ICML 2024 论文,20 篇 / 8316 子任务)考察长程自主执行能力。Deep Research 类系统的评测需关注引用支持度、多源一致性、长程稳定性,而非单点答案正确率(见 LLM 评估)。
引用可溯源
Deep Research 的可信度核心在引用可溯源:每个 claim 须挂靠可核验来源,与 联网搜索评测 的 citation support rate / hallucination rate 指标体系一致。
矛盾或新想法
? 本批次来源中,文件名含 “deep-research” 的两份(
deep-research-report.md实为 LLM-HTML 生成设计文档、skills-deep-research-report.md实为 Skills 分类研究)并非真正讨论 Deep Research 系统——命名与内容不符。本主题页主要综合多智能体编排来源 + wiki 既有 Claude Deep Research 架构,直接的 Deep Research 一手来源在本批次较稀缺,建议后续补充专门的 Deep Research 来源。