E-Bench

腾讯混元团队发布的有状态产品环境 Agent 评测基准(2026-07-28,arXiv 2607.23722):王者荣耀 / QQ 音乐 / 腾讯会议三场景合成 323 道多步工具调用任务,同时计量任务完成率、Pass³ 可靠性API 成本。姊妹基准:WorkBuddy Bench

环境与出题设计

  • 合成平行世界:41 张表、345 列、69 条外键约束、7.6 万行数据、1,219 个实体。
  • 信息差(“出题者全知、解题者半盲”):出题者(Claude Opus 4.7)全知——可 SQL 查全库、执行代码并记录数据库变更作为标准答案;解题者半盲——只能用业务级工具(搜歌、查日程、加好友),无循环/聚合/SQL。答案取决于数据库实际状态,无法从题面猜测。
  • 任务可解性验证:三个强模型(GPT-5.5、Claude Opus 4.7、GLM-5.1)独立验证,至少两个通过才收录。
  • 环境与任务不开源(防针对性训练),仅覆盖单产品内任务——与 WorkBuddy Bench 的全开源路线互补,是两种防背题/防过拟合策略。

成绩单

  • 总分:11 个前沿模型中最强的 Kimi-K3 也只有 73.79%
  • 可靠性(真瓶颈):Kimi-K3 Pass@3 = 87.62% vs Pass³ = 58.82%(三次全对);目前无模型 Pass³ 超过 60%——做对一次是运气,连续做对才是能力。
  • 代码执行改写排名:开放代码执行后 Claude Opus 4.8 68.78%→81.11% 登顶,反超 Kimi-K3(77.61%)与 GPT-5.5(77.19%);Gemini-3.5-Flash 从第 9 冲到第 6(+47%)。
  • 场景难度:王者荣耀最难(平均 43.64%)< 腾讯会议(58.87%)< QQ 音乐最易(61.39%)。
  • 极端任务示例:紧急跨部门拉会需 13 轮对话、94 次工具调用完成 15 个数据库状态变更(HY-3 全部做对)。

成本统计

模型单任务成本准确率
[[wiki/entities/DeepSeekDeepSeek-V4-Pro]]0.028 美元
[[wiki/entities/Kimi-K3Kimi-K3]]0.634 美元

成本与准确率不成比例——选型须看”场景 × 可靠性 × 成本”多维成绩单(见 Agent 评测范式演变)。

已知短板(论文自述)

环境为合成、与真实线上产品复杂度有差距;为防针对性训练环境和任务不开源;仅覆盖单产品内任务。

关联