E-Bench
腾讯混元团队发布的有状态产品环境 Agent 评测基准(2026-07-28,arXiv 2607.23722):王者荣耀 / QQ 音乐 / 腾讯会议三场景合成 323 道多步工具调用任务,同时计量任务完成率、Pass³ 可靠性与 API 成本。姊妹基准:WorkBuddy Bench。
环境与出题设计
- 合成平行世界:41 张表、345 列、69 条外键约束、7.6 万行数据、1,219 个实体。
- 信息差(“出题者全知、解题者半盲”):出题者(Claude Opus 4.7)全知——可 SQL 查全库、执行代码并记录数据库变更作为标准答案;解题者半盲——只能用业务级工具(搜歌、查日程、加好友),无循环/聚合/SQL。答案取决于数据库实际状态,无法从题面猜测。
- 任务可解性验证:三个强模型(GPT-5.5、Claude Opus 4.7、GLM-5.1)独立验证,至少两个通过才收录。
- 环境与任务不开源(防针对性训练),仅覆盖单产品内任务——与 WorkBuddy Bench 的全开源路线互补,是两种防背题/防过拟合策略。
成绩单
- 总分:11 个前沿模型中最强的 Kimi-K3 也只有 73.79%。
- 可靠性(真瓶颈):Kimi-K3 Pass@3 = 87.62% vs Pass³ = 58.82%(三次全对);目前无模型 Pass³ 超过 60%——做对一次是运气,连续做对才是能力。
- 代码执行改写排名:开放代码执行后 Claude Opus 4.8 68.78%→81.11% 登顶,反超 Kimi-K3(77.61%)与 GPT-5.5(77.19%);Gemini-3.5-Flash 从第 9 冲到第 6(+47%)。
- 场景难度:王者荣耀最难(平均 43.64%)< 腾讯会议(58.87%)< QQ 音乐最易(61.39%)。
- 极端任务示例:紧急跨部门拉会需 13 轮对话、94 次工具调用完成 15 个数据库状态变更(HY-3 全部做对)。
成本统计
| 模型 | 单任务成本 | 准确率 |
|---|---|---|
| [[wiki/entities/DeepSeek | DeepSeek-V4-Pro]] | 0.028 美元 |
| [[wiki/entities/Kimi-K3 | Kimi-K3]] | 0.634 美元 |
成本与准确率不成比例——选型须看”场景 × 可靠性 × 成本”多维成绩单(见 Agent 评测范式演变)。
已知短板(论文自述)
环境为合成、与真实线上产品复杂度有差距;为防针对性训练环境和任务不开源;仅覆盖单产品内任务。