Agent 评测范式演变:从单榜全能排名到多维成绩单
论点
Agent 评测正在经历一次范式转移:单榜全能排名让位于”场景 × 执行环境 × 可靠性 × 成本”的多维成绩单。2026 年 8 月前后有三个独立信号共同标志这一转变。
三个信号
1. 腾讯两基准:成绩单的四个轴一次配齐
WorkBuddy Bench(260 题)+ E-Bench(323 任务):
- 场景轴:代码/前端/办公/安全四赛道 + 王者荣耀/QQ音乐/腾讯会议三产品场景——没有一个前沿模型通吃(Claude Opus 4.8 领先代码、GPT-5.5 办公 86.05、GLM-5.2 安全双环境第一、Kimi-K3 E-Bench 总分 73.79%)。
- 执行环境轴:7 模型 × 2 环境 = 8 张成绩单;代码赛道 GPT-5.5 与 GLM-5.2 排名随环境互换。
- 可靠性轴:Pass@3 87.62% vs Pass³ 58.82%,无模型 Pass³ 超 60%——单次通过率不再是合格指标。
- 成本轴:单任务 API 成本随分报告(DeepSeek-V4-Pro 0.028 美元/47.7% vs Kimi-K3 0.634 美元/73.8%)。
⚠️ 矛盾 [2026-08-10] 模型分数不是模型的固有属性,而是”模型 × 执行环境/工具链”的组合属性——这与把 benchmark 分数当作模型绝对能力指标、据此定价采购的常见用法直接冲突。
2. HarnessOpt-Bench:被测对象从”模型答题”扩展到”模型 × harness 组合”
Scale AI 的 HarnessOpt-Bench(arXiv 2608.06301,8/9 日报)把”LLM 能否自动优化另一个 agent 的 harness”本身变成可打分的能力;结论”optimizer 模型间差距 > 编码 harness 间差距”说明评测的最小单位正在从模型变为系统。同期 Floatboat 的 HLR 计量(同权重换 harness,DeepSWE +12.85 分)与 Endpoint Accuracy Index(同权重换 endpoint,准确率差近一半)从两个方向量化了”模型之外皆是变量”。
3. FinEvo-Bench:时间轴进入成绩单
北航 + 阿里云通义点金的 FinEvo-Bench(arXiv 2608.06144,8/10 日报)纵向评测自进化 agent:第 4–6 个任务增益比第 1–3 个高 6.10–8.70 分,且设无记忆对照——评测从”此刻能力快照”走向”随任务流的进化轨迹”,并要求质量 + 合规双评。
“分数”正在被重新定义
| 旧范式 | 新范式 |
|---|---|
| 分数 = 模型的固有属性 | 分数 = 模型 × 工具链/endpoint 的组合属性 |
| 分数 = 单次通过率 | 分数 = 多次运行分布(Pass@k vs Pass³) |
| 分数 = 与成本无关 | 分数 = 成本的函数(每任务美元) |
| 分数 = 静态快照 | 分数 = 进化轨迹(纵向对照) |
| 分数 = 聚合值 | 分数 = 聚合值 + 轨迹级归因(CauAudit 揭示聚合分数掩盖工具调用真实生效率) |
含义
- 选型方:要”场景化选模型”——先定场景与工具链,再看该组合下的可靠性与成本;不存在全能冠军。
- 建榜方:单榜排名的公信力持续衰减(对照本库 古德哈特定律 与 LatentRank 聚合尝试);新基准的竞争点在出题防污染、可靠性度量与成本透明度。
- 产业侧:与 AI 评测行业 的”评测即持续验证服务”判断同向——买方买的是放心,不是一次跑分。
追问
- Pass³ 之外,生产部署需要什么样的”连续正确”保证(SLA 化的可靠性指标)?
- 多维成绩单如何聚合成可决策的选型结论而不退回单一数字崇拜?
- harness/endpoint 作为被测变量后,“模型厂商 vs 系统厂商”的评测责任如何划分?