联网搜索评测

联网搜索(AI Search / Web Search Agent)评测专门解决”如何判定一个联网搜索 Agent 的结果好坏”——核心难点是无人工标注预算下的客观性搜索结果的时效性漂移。本页综合本批次三份来源,构成”用什么 query 评 + 怎么评 + 评什么产品”的完整方法栈。


方法栈全景

来源解决
Query 数据集[[wiki/sources/中文联网搜索 Query 评测数据集构建方法论与实施方案.mdQuery 数据集方案]]
成对评测方法[[wiki/sources/web-search-agent-eval-方案.md成对评测方案]]
产品对比[[wiki/sources/Eight Cloud RAG and AI Search Products_ Comparative Evaluation with Chinese Four-Modal Benchmark Methodology (June 2026).md八款产品对比]]

成对评测架构(五层)

成对评测方案 的核心架构:

  1. 采集:双 Agent 同时段跑 + 引用源当日快照(控时效漂移)。
  2. Claim 校验管线(客观层):答案拆 atomic claims → fetch 引用源 → 三分类(supported/contradicted/not_found);强制 evidence_quote 并程序化校验存在性(防 verifier hallucinate)。产出 citation support rate / hallucination rate。
  3. 3-Judge Jury(主观层):3 个跨家族 frontier judge × position swap = 每样本 6 次;rubric 反 bias;只裁真主观维度(覆盖度、组织质量)。
  4. 聚合统计:majority / unanimous win rate + bootstrap CI + sign test / McNemar + sensitivity analysis。
  5. 质量保障:judge 健康度(swap 不一致率、Fleiss’ κ、长度相关性)+ bias 自检 + 人工 audit(抽 20–30 条分歧样本)。

方法源头:FActScore、SAFE、RAGAS faithfulness、PoLL。


Query 数据集构建

Query 数据集方案 的要点:

  • 真实/拟真 query 优先,避免纯合成 query 的分布偏移。
  • 分层分类:时效类 / 多跳类 / 简单查找 / 实体类——“整体赢 ≠ 每类都赢”。
  • 冻结版本三元组(query 集 + 标注 + 时间快照),保证跨期可比。
  • 可验证子集做 judge 选型校准锚点。

产品对比方法

八款产品对比 的方法贡献:

  • 黑盒 vs 可观测:黑盒产品只能端到端评;可观测产品可分层定位。
  • 默认 vs 对齐两档参数:避免用调优成绩冒充默认能力。
  • 时效控制:同时段采集 + 引用源快照。

关键风险清单

风险对策
网页时效漂移同时段采集 + 当日快照 / controlled replay
Judge self-preference跨家族选型,不与被评同源
位置偏差双向 swap + 数据层随机
长度/风格 biasrubric 反 bias + 长度相关性检验
Judges 共错claim 机械验证 + 可验证子集 + 人工 audit
Verifier hallucination强制 evidence_quote + 程序化校验
Judge 版本漂移锁死 model string

矛盾或新想法

全自动闭环的系统性共错风险:judges 一致 ≠ 正确,若三个 judge 共享同源偏好,claim 管线与人工 audit 是仅有的纠偏手段,方案内部无法完全消除共错(见 LLM 评估)。

⚠️ 矛盾 [2026-07-25] 真实 query(贴近线上但贵、漂移)vs 合成 query(易得但有分布偏移)的取舍,是搜索/RAG 评测的共性张力(见 RAG)。