LLM 评测的主客观分裂与”实验室≠生产”
同一个模型,在主观偏好榜和客观任务榜上可以排到截然相反的名次;而无论哪个榜,成绩都无法直接外推为生产表现。评测口径决定结论。
争议各方与证据
- 立场 A(主观偏好):LMSYS Chatbot Arena 用人类偏好 Elo 动态对抗,捕捉”用起来好不好”,但受长度/风格 bias 影响(评测来源版图)。
- 立场 B(客观任务):HELM、OpenCompass 可复现、机械判定,但易被刷榜/数据污染;商业榜则利益相关。三类榜单对同一模型排名互相冲突,聚合不能做简单平均(同上)。
- 立场 C(实验室≠生产):τ-bench 单次 pass^1≈61% 掉到多次一致 pass^8≈25%;METR SWE-bench grader 通过 ~72% 但实际 merge 率仅 ~48%——榜单成绩系统性高估生产可靠度(LLM 评估)。
- 立场 D(同源案例):HTML 生成中 Claude 在 WebDev Arena(主观)第一,GPT-5 却在 ArtifactsBench(客观)以 72.55 居首——“谁最会写前端”完全取决于口径(LLM-HTML 生成、HTML 研究报告)。
证据质量评估
四类来源各有结构性偏差:Arena 主观但贴近真实用户,偏差来自人类偏好(偏长、偏自信);HELM 客观可复现但静态、易污染;商业榜利益相关需标注利益冲突;生产实测(τ-bench pass^k、METR merge 率)最接近真实价值,但成本高、覆盖窄。关键不对称是:实验室榜单易得、口径单一;生产可靠度难以一次测量。因此生产实测证据的权重应高于单一榜单,而主观/客观之间不存在”谁更真”,只存在”测的是不同维度”。
当前最佳判断
当前最站得住脚的结论:任何单一榜单都不足以选型;必须在主观偏好、客观任务、生产实测三个维度交叉验证,并明确每个数字的口径。 具体而言:(1) 选型看与自己业务同构的可验证子集,而非综合排名;(2) 报告 pass^k(k>1)而非 pass^1,以暴露一致性衰减;(3) 用客观 claim 管线(FActScore/RAGAS)+ 跨家族 jury + position swap + 人工 audit 来同时约束主观与客观偏差(联网搜索评测)。“实验室≠生产”不是榜单的失败,而是评测范式的固有边界。
仍待解决的问题
? judges 一致 ≠ judges 正确:若多个 judge 共享同源偏好,claim 管线与人工 audit 是仅有的纠偏手段,全自动闭环的系统性共错风险无法在方案内部完全消除(LLM 评估)。
- 主观偏好与客观质量之间是否存在稳定的”换算关系”,目前无证据。
- pass^k 衰减的根因(错误累积 vs 采样方差)尚需分解。
- 商业榜的利益冲突披露尚无行业强制标准。
关联
- wiki/topics/LLM评估 — 本争议的方法论母题
- wiki/analyses/能力与安全非单调 — Opus 4.8 能力↑安全↓是”榜单维度不可互相外推”的另一例
- wiki/analyses/AI编程价值之争 — 编程 Agent 的 ROI 之争同样卡在评测口径
- wiki/topics/LLM-HTML生成 · wiki/topics/联网搜索评测