LLM 评测的主客观分裂与”实验室≠生产”

同一个模型,在主观偏好榜和客观任务榜上可以排到截然相反的名次;而无论哪个榜,成绩都无法直接外推为生产表现。评测口径决定结论。

争议各方与证据

  • 立场 A(主观偏好):LMSYS Chatbot Arena 用人类偏好 Elo 动态对抗,捕捉”用起来好不好”,但受长度/风格 bias 影响(评测来源版图)。
  • 立场 B(客观任务):HELM、OpenCompass 可复现、机械判定,但易被刷榜/数据污染;商业榜则利益相关。三类榜单对同一模型排名互相冲突,聚合不能做简单平均(同上)。
  • 立场 C(实验室≠生产):τ-bench 单次 pass^1≈61% 掉到多次一致 pass^8≈25%;METR SWE-bench grader 通过 ~72% 但实际 merge 率仅 ~48%——榜单成绩系统性高估生产可靠度(LLM 评估)。
  • 立场 D(同源案例):HTML 生成中 Claude 在 WebDev Arena(主观)第一,GPT-5 却在 ArtifactsBench(客观)以 72.55 居首——“谁最会写前端”完全取决于口径(LLM-HTML 生成HTML 研究报告)。

证据质量评估

四类来源各有结构性偏差:Arena 主观但贴近真实用户,偏差来自人类偏好(偏长、偏自信);HELM 客观可复现但静态、易污染;商业榜利益相关需标注利益冲突;生产实测(τ-bench pass^k、METR merge 率)最接近真实价值,但成本高、覆盖窄。关键不对称是:实验室榜单易得、口径单一;生产可靠度难以一次测量。因此生产实测证据的权重应高于单一榜单,而主观/客观之间不存在”谁更真”,只存在”测的是不同维度”。

当前最佳判断

当前最站得住脚的结论:任何单一榜单都不足以选型;必须在主观偏好、客观任务、生产实测三个维度交叉验证,并明确每个数字的口径。 具体而言:(1) 选型看与自己业务同构的可验证子集,而非综合排名;(2) 报告 pass^k(k>1)而非 pass^1,以暴露一致性衰减;(3) 用客观 claim 管线(FActScore/RAGAS)+ 跨家族 jury + position swap + 人工 audit 来同时约束主观与客观偏差(联网搜索评测)。“实验室≠生产”不是榜单的失败,而是评测范式的固有边界。

仍待解决的问题

judges 一致 ≠ judges 正确:若多个 judge 共享同源偏好,claim 管线与人工 audit 是仅有的纠偏手段,全自动闭环的系统性共错风险无法在方案内部完全消除(LLM 评估)。

  • 主观偏好与客观质量之间是否存在稳定的”换算关系”,目前无证据。
  • pass^k 衰减的根因(错误累积 vs 采样方差)尚需分解。
  • 商业榜的利益冲突披露尚无行业强制标准。

关联