LLM 评估
LLM/Agent 评估正经历范式转移:从”答案正确率”走向”系统级任务完成能力”,从”一次性公共榜单”走向”持续私有评测(AgentOps + Private Eval)“。本页综合本批次来源,是该领域矛盾与方法的汇聚点。
范式转移:从模型评测到系统评测
Agent 评测趋势 与 交互式报告 的核心命题:
- 评测对象 = 系统:输入含模型 + 提示 + 工具 + 记忆 + 检索 + 权限 + 环境 + 版本,才能解释同模型不同 harness 下的差异。
- 五类维度融合:输出质量、行为过程、交互能力、多智能体协作、安全/性能。
- 成本感知:仅优化准确率可能放大成本 4.4–10.8×;企业级必须看成本/延迟/稳定性。
- 从答案到轨迹:评测越来越依赖完整 trace(每步 observation/reasoning/tool call/error/cost)。
- 三层评分器:规则/代码断言(稳定)+ LLM-as-Judge(开放任务)+ 人工抽检(校准/安全关键)。
权威来源版图
评测来源版图调研 的四类来源分工:
| 阵营 | 代表 | 特点 |
|---|---|---|
| 竞技场(主观偏好) | LMSYS Chatbot Arena | 人类偏好 Elo,动态对抗 |
| 学术基准(客观可复现) | HELM、OpenCompass | 可复现,但易被刷榜/污染 |
| 官方/标准(权威滞后) | CAICT 方升、ITU-T F.748.44 | 权威但更新慢 |
| 中文生态 | SuperCLUE、FlagEval、CAICT 方升 | 与英文 HELM/Arena 互补 |
聚合平台要点:来源溯源、版本快照、指标对齐(口径不可直接比)、利益冲突标注。
LLM-as-Judge 偏差与缓解
联网搜索成对评测方案 系统总结 judge 偏差缓解:
- 跨家族 jury(PoLL):3 个不同家族 frontier judge,不与被评 Agent 同源(防 self-preference)。
- Position swap:每样本正逆序各调一次(3 judge × 2 = 6 次),消除位置偏差。
- Rubric 反 bias:明写”长度非优点、自信不加分、引用多≠支持度高”。
- 客观锚点:claim 管线(FActScore/SAFE/RAGAS)把事实/引用维度从主观印象拆成机械判定。
- 健康度监控:swap 不一致率 >20% 踢出、票-长度相关性查 bias、Fleiss’/Cohen’s κ <0.4 先修 rubric。
- 可验证子集校准:谁准用谁,不凭名气选 judge。
Private Eval:企业私有持续评测
Private Eval 战略 提出企业侧范式:
- 用企业自有真实任务+数据+规则+工具+结果标准持续评估,非”公开 benchmark 搬进内网”。
- 效用函数
U = w_q·Q − w_r·R − w_c·C − w_l·L(质量减风险/成本/延迟加权)。 - L0–L4 成熟度 + Traces / Eval / RLE 三层架构。
- 护城河 = 谁拥有持续优化的 “Hill-climbing Machine”。
矛盾或新想法
⚠️ 矛盾 [2026-07-25] 实验室榜单 ≠ 生产可靠:τ-bench pass^1≈61% 掉到 pass^8≈25%(多次一致性骤降);METR SWE-bench grader ~72% 但实际 merge 率 ~48%。榜单成绩无法直接外推为生产表现。
⚠️ 矛盾 [2026-07-25] 主观/客观评测系统性分歧:Arena 主观偏好 vs HELM 客观任务 vs 商业榜利益相关,对同一模型排名互相冲突。聚合不能做简单平均(来源版图);HTML 生成中 Claude 主观第一 vs GPT-5 客观第一(HTML 研究)是同源案例。
⚠️ 矛盾 [2026-07-25] 能力与安全非单调同步:Opus 4.8 诚实度提升但 prompt-injection 鲁棒性回归(9.6% vs 4.7 的 6.0%)——通用能力进步不保证安全维度同步(Opus 4.8)。
? judges 一致 ≠ judges 正确:若多 judge 共享同源偏好(偏长/偏引用多),claim 管线与人工 audit 是仅有的纠偏手段;全自动闭环的系统性共错风险无法在方案内部完全消除。
LLM-as-Judge 三日集群(2026-08-03 ~ 08-05 评测日报)[2026-08-06]
- 判官依赖性(8/3):预注册审计显示通用 helpfulness 分不出”直接给答案”与”引导式教学”(pedagogy rubric 完全分离);helpfulness 排序在 3 个 base 中 2 个换判官后翻转。
- 审计者偏差特异(8/4,Chain-of-Models):单体抗偏能力不能预测审计效果(Kimi-K2.5 最强单体却是弱审计者);最佳审计者按偏差类型配对——GPT-4o 对 bandwagon/authority/distraction 最强、GLM-5 对 sycophancy 最强。→ 应建”审计者 × 偏差类型”配对表。
- 评审间一致性必须报告(8/4,AI Scientist 评审):Gemini–Claude ρ=0.907,GPT-5.4 仅 ρ≈0.32(显著离群);且基准论文由 FARS 商业公司提供而结论恰为 FARS 最优(利益相关)。
- 廉价 judge 降本(8/5):GPT-OSS-120B / DeepSeek-V4-Flash / Gemma-4-31B 在 IMO-GradingBench 与 Opus 4.7 / Gemini 3.1 Pro 一致率统计不可区分、成本最多低 100 倍;all-three-pass 规则最优。
- 人类偏好评测的固有偏差(8/5,Villanova,1,682 人):AI 生成故事质量评分高 6%、吸引力高 8%;“作者是人类”标签再 +3%;识别 AI 准确率仅 40%/52%。→ RLHF 模型在”人类偏好分”上天然占优;人工评测必须盲化作者身份标签。
- vendor benchmark 表固定检查项(8/4):“对比基线是否同级”——Qwen3.8-Max 多模态表对比 Qwen3.7-Plus 而非同级 Max,会放大代际差。另:Arena 8 月起 Direct 投票计入榜单,Elo 前后不完全可比(趋势图打断点)。
项目制评测(Karpathy,2026-08-05)
来源:Karpathy《指环王》+ Three.js 评测。开放任务 + 固定预算 + 长程观察,位于静态基准与单轮 Demo 两极之间:《指环王》第一段 + 100 万 token(≈$10)+ Three.js;Opus 5 连续工作约 2 小时、产出 5500 行代码。五问指标:固定预算内完成度 / 人工纠正量 / 规模一致性 / 目标保持 / 自我修复。核心发现:自我验证能力显著落后于生成能力(只能靠不同时间点截图判断效果);“工作耐力”(endurance)成为独立评测维度。测评原则:“如果一项测评只能带来惊叹,却无法暴露能力边界,那么它更像广告,而不是测评。“
工业实践佐证:美团图灵评测方法论(2026-08-07)
Agent 评测漫谈(美团图灵 Agent 评测团队两年实践公开版)从工业侧佐证本页”从模型评测到系统评测”的范式转移,并给出落地工程方法:
- 评测对象 = 复杂系统:“模型 + 系统 + 工具 + 流程”耦合后能否稳定交付好结果;评测覆盖结果/过程/效率/风险四层;观测(Trace)是评测基石(观测 + 评测 = 持续迭代)。
- 桥梁指标:模型能力指标与业务结果指标之间须搭桥(业务 → 系统 → Agent 三层),回答”为什么业务指标变差”。
- 人人/人机一致:Rubric 下钻 + 二元化 + 一致率阈值(85%/90%)对齐主观评测——与本页”LLM-as-Judge 偏差与缓解”构成上游标准对齐 × 下游判官治理的互补关系。
- 数据飞轮:采集 → 清洗 → 评测 → 质检 → 分析/归因,评测体系靠 Good/Bad Case 喂养演进。
- 从 Query→Answer 到 Prompt→Expected Behavior:长程 Agent 使评测从文本质量转向行为评测,标准答案不再唯一,过程质量与轨迹质量成为核心对象;评测链路从人评主导走向机评主导。
- 详见 AI Agent Evaluation、LLM-as-Judge、Agent 评测基准。