LLM-as-Judge

LLM-as-Judge 是一种用大模型自动评估其他模型/Agent 输出质量的评测范式,弥补人工标注的高成本与低吞吐。该主题涵盖 Agent 评测系统构建、RAG 横评设计、评测前沿趋势(2025H2-2026H1)等实践,关注评估指标的可靠性、偏见与对齐。

人人一致、人机一致:美团的 judge 对齐工程实践(2026-08-07)

来源:Agent 评测漫谈美团图灵评测团队)。与本页既有的”判官有偏差”治理互补——它解决的是更上游的”标准未对齐”问题:若人与人、人与机评得不一样,无法区分指标抖动与真实效果提升。

  • 人人一致:一位强有力的”独裁者”角色拉齐产品/运营/研发/QA 的评测标准,遵循同一套体系,避免各自为政;评测员用背靠背标注对齐。
  • 人机一致:机器评测结果须与人工评测一致,否则不置信;其意义在规模化提效,以应对更大业务流量。只有人机一致率有保障,才称得上”自动化评测”,否则只是机器预标注。
  • 三步对齐法:① 指标下钻——把”大而模糊”的概念拆成清晰评测维度(Rubric,术语口径与 Arize AI 对齐);② Rubric 二元化——打分规则尽量收敛为 是/否/未知(0/1/unknown);③ 持续迭代——用 unknown 占比反查 Rubric 定义是否合理,直到单条 Rubric 的人人/人机一致率达到可信阈值(如 85%/90%)。示例:把”回答是否口语化(0-10 分)“下钻为”是否用‘您’指代""是否用‘甭客气/明儿见’等口语词""是否含‘吧/呢/那个’等语气词”三个二元判据。
  • 自报成效:数字站长人机一致率 99%;Beam 以二元化方案改造评测体系后从 62% 提升到 92%。
  • 长程 Agent 场景加速”人评主导 → 机评主导”:轨迹信息密度高使人成为卡点、Skill 数量激增使人工标注不可持续、基座能力持续突破——链路从”核心评测员对齐 → 外包对齐 → 机评对齐”缩短为”核心评测员对齐 → 机评对齐 → 规模化”。人工退守高价值标准设计与 Rubric 对齐,AI 承担规模化运行、初筛与回归验证——AI 评测真正放大的是核心评测员的判断标准,而非”机器打分”本身。

一致率数字为美团内部自报,无第三方验证。与本节互补的下游手段:跨家族 jury(PoLL)、position swap、κ 健康度监控(见 LLM 评估”LLM-as-Judge 偏差与缓解”)。

[2026-08-10] Judge 可靠性证据链(8/8–8/10 三日密集波次)

来源:评测日报 08-0808-0908-10。结论从”judge 有偏差”推进到”单 judge 打分不可靠”:

  1. Evidence Lock 反效果(arXiv 2608.05353):HelpSteer3 / FeedbackQA / CoVal 三数据集、Claude Sonnet 4.5 与 GPT-5 两个 judge 共 24,000 次判决对照——把 judge 拆成”抽取证据→判分”且切断原文访问后,与人类偏好一致性下降 4–6 个百分点,答案顺序不一致性上升 8–10pp。结论:持久化证据只做旁路留痕,判分时必须可见原答案
  2. 随机数探针可测数字偏差(arXiv 2608.05726,JAIST):让 LLM 随机生成数字 token,用观测分布对均匀分布的偏离度量”潜在数字偏差”,再反向校正评分 token 概率;四个任务上优于已有校准方法。偏差随模型/任务/分数区间变化,必须逐场景测量——跨模型 judge 的分数不可直接比较
  3. grader 换模型分数微涨:AA Intelligence Index v4.1.1 把 HLE / AA-LCR / AA-Omniscience 判分统一换成 GPT-5.6 Luna(替换 GPT-4o / Qwen3 235B / Gemini 3 Flash Preview),整体变动 <1 分但分数微涨——judge 测量效度问题的又一次印证(见 Artificial Analysis)。
  4. 单 judge 忠实度判定极其脆弱(arXiv 2608.05153,RAG 三轴稳健性审计 4,440 次实验):GPT-5.4 跨 embedder 自我一致性 kappa 仅 0.137,41% 条目判决翻转

操作规则:单 judge 打忠实度分的做法应当停止——至少做跨配置 self-kappa 检查;judge 的模型版本/配置必须记入评测元数据(与 RAG 评测数据集 的”版本三元组冻结”呼应)。

[2026-08-10] 对照立场:WorkBuddy Bench 全程不用大模型当裁判

来源:腾讯 Agent 评测。腾讯 WorkBuddy-Bench 安全赛道(60 题,38 攻击 + 22 防御)坚持确定性程序打分 + 五层反作弊、全程不用大模型当裁判——这是对 LLM judge 可靠性争论的一次立场表态:凡评测对象可程序化验证(代码、数据库状态、文件),优先用确定性验证器。与上面证据链构成”治偏差”与”绕开 judge”两条路线的对照。

关联