联网搜索评测
联网搜索(AI Search / Web Search Agent)评测专门解决”如何判定一个联网搜索 Agent 的结果好坏”——核心难点是无人工标注预算下的客观性与搜索结果的时效性漂移。本页综合本批次三份来源,构成”用什么 query 评 + 怎么评 + 评什么产品”的完整方法栈。
方法栈全景
| 层 | 来源 | 解决 |
|---|---|---|
| Query 数据集 | [[wiki/sources/中文联网搜索 Query 评测数据集构建方法论与实施方案.md | Query 数据集方案]] |
| 成对评测方法 | [[wiki/sources/web-search-agent-eval-方案.md | 成对评测方案]] |
| 产品对比 | [[wiki/sources/Eight Cloud RAG and AI Search Products_ Comparative Evaluation with Chinese Four-Modal Benchmark Methodology (June 2026).md | 八款产品对比]] |
成对评测架构(五层)
成对评测方案 的核心架构:
- 采集:双 Agent 同时段跑 + 引用源当日快照(控时效漂移)。
- Claim 校验管线(客观层):答案拆 atomic claims → fetch 引用源 → 三分类(supported/contradicted/not_found);强制 evidence_quote 并程序化校验存在性(防 verifier hallucinate)。产出 citation support rate / hallucination rate。
- 3-Judge Jury(主观层):3 个跨家族 frontier judge × position swap = 每样本 6 次;rubric 反 bias;只裁真主观维度(覆盖度、组织质量)。
- 聚合统计:majority / unanimous win rate + bootstrap CI + sign test / McNemar + sensitivity analysis。
- 质量保障:judge 健康度(swap 不一致率、Fleiss’ κ、长度相关性)+ bias 自检 + 人工 audit(抽 20–30 条分歧样本)。
方法源头:FActScore、SAFE、RAGAS faithfulness、PoLL。
Query 数据集构建
Query 数据集方案 的要点:
- 真实/拟真 query 优先,避免纯合成 query 的分布偏移。
- 分层分类:时效类 / 多跳类 / 简单查找 / 实体类——“整体赢 ≠ 每类都赢”。
- 冻结版本三元组(query 集 + 标注 + 时间快照),保证跨期可比。
- 可验证子集做 judge 选型校准锚点。
产品对比方法
八款产品对比 的方法贡献:
- 黑盒 vs 可观测:黑盒产品只能端到端评;可观测产品可分层定位。
- 默认 vs 对齐两档参数:避免用调优成绩冒充默认能力。
- 时效控制:同时段采集 + 引用源快照。
关键风险清单
| 风险 | 对策 |
|---|---|
| 网页时效漂移 | 同时段采集 + 当日快照 / controlled replay |
| Judge self-preference | 跨家族选型,不与被评同源 |
| 位置偏差 | 双向 swap + 数据层随机 |
| 长度/风格 bias | rubric 反 bias + 长度相关性检验 |
| Judges 共错 | claim 机械验证 + 可验证子集 + 人工 audit |
| Verifier hallucination | 强制 evidence_quote + 程序化校验 |
| Judge 版本漂移 | 锁死 model string |
矛盾或新想法
? 全自动闭环的系统性共错风险:judges 一致 ≠ 正确,若三个 judge 共享同源偏好,claim 管线与人工 audit 是仅有的纠偏手段,方案内部无法完全消除共错(见 LLM 评估)。
⚠️ 矛盾 [2026-07-25] 真实 query(贴近线上但贵、漂移)vs 合成 query(易得但有分布偏移)的取舍,是搜索/RAG 评测的共性张力(见 RAG)。