Agent 评测基准

Agent 评测基准是系统衡量 AI Agent 在真实任务中表现的标准框架,涵盖 Terminal-Bench、SWE-bench-Pro、Agent Arena 等多个维度。评测关注 Agent 的任务通过率、成本效率、失败模式(如未验证即宣称完成)以及跨领域表现的差异性。核心观点是不存在全场景最强的 Agent,关键信号在于成败模式如何随领域变化。

新增基准(2026-08-06 批次)

来源:评测日报 08-0308-0408-05

  • ORCA-bench(Cornell Tech 等):把 coding agent 放进真实 oncall 排障环境(OpenTelemetry 微服务 + 50GB 遥测 + 1,079 个 RCA 任务);五个前沿 agent 最好成绩 Medium 25.3% / Hard 10.0%;最差模型在 40% 报障上编造不成立的根因;LLM judge 与人工复评 κ_w=0.90。
  • MirrorCode(Epoch AI,与 METR 合作,2026-08-03 正式更新):长周期编码基准——看不到原始源码、端到端重新实现整个程序、输出须与含 held-out 测试的原程序逐字节一致、模型断网、每任务 100 亿 token / 7 天上限 × 3 次运行;22/25 目标程序开源 + 3 私有 holdout + 记忆化筛查。榜位:Claude Fable 5 64% / GPT-5.6 Sol 20% / GPT-5.4 16% / GPT-5.5 10%(同代 3 倍差距罕见)。已知案例:Opus 4.7 用 14 小时、$251 重实现约 1.6 万行 Go 工具 gotree(人类 2–17 周)。可信度状态演进:8/4 日报”无方法学、暂不建议引用” → 8/5 官方披露后评 8/10。
  • OmegaUse-OfficeVal(百度):100 个长程办公任务、平均人力 2.32 小时、人力工时+价格双经济信号、代码 verifier 评分、数据集开源。
  • RepBench:353 个公开 benchmark 编译为 46,149 条能力探针、94 项能力;difference-in-means 与 logistic regression 两种读出结论不一致——读出方法是实质评测维度。
  • AgentMemBench:五种记忆策略横评(见 AI Agent 记忆)。

版本注意:Terminal-Bench 2.0(Meta 记忆论文:38%→46%)与 2.1(Qwen3.8-Max 86.6、进入 AA Index 底层九项)分数不可直接比较,记录须标版本号。

OpenClaw(龙虾)生态评测基准(2026-08-07 批次)

来源:Agent 评测漫谈附录行业调研。2026 年 2 月 OpenClaw(龙虾)全球爆火后,社区涌现出面向它的真实场景评测基准(共同理念:不用合成测试/精制沙盒,而是真实工作与使用场景):

基准发布方/定位规模
PinchBench(pinchbench/skill,2026-02 开源)OpenClaw 专用性能基准,给 Agent 布置实际工作中会遇到的复杂多步任务,衡量真实开发/办公环境表现1200+ md 任务定义
claw-eval(claw-eval/claw-eval)北大发布的龙虾能力评测,yaml 任务定义500 yaml 任务
WildClawBench(InternLM/WildClawBench)“野生环境”评测——把模型扔进真实用户每天使用 OpenClaw 的场景看能否存活,横评 10 大模型500 Skill

claw-eval 的”北大”发布方未证实是否即 北大 DCAI 团队;源文附录中”GitStar(task 定义)“一项亦背景不明。

评测词汇表(源文综合 Anthropic 与开源项目的定义,可作本库术语规范参考):

  • Task / Trial(任务/试验):具有明确输入和成功标准的单个测试;同一任务多次运行试验以对冲模型输出随机性。
  • Grader / Checks(评分器/断言):评估 Agent 性能某方面的逻辑;一个任务可有多个评分器,每个含多个断言。
  • Transcript = Trace = Trajectory(记录):试验的完整记录——输出、工具调用、推理、中间结果与一切交互。
  • Outcome(结果):试验结束时环境的最终状态,区别于 Agent 的自述输出(如”航班已预订” vs 数据库中是否真有预订记录)。
  • Evaluation Harness(评估框架):端到端运行评估的基础设施——提供指令与工具、并发跑任务、记录全程、评分并汇总。
  • Agent Harness / Scaffold(Agent 框架):使模型能作为 Agent 运行的系统;评估”一个 Agent”= 评估框架与模型协同工作。
  • Evaluation Suite(评估套件):测量特定能力/行为的任务集合(如客户支持套件含退款、取消、升级任务)。

腾讯双基准:WorkBuddy Bench 与 E-Bench(2026-08-10 批次)

来源:腾讯 Agent 评测 WorkBuddy-Bench 与 E-Bench。腾讯 2026-07 一周内开源两篇,合计 583 题,公开内部场景化选模型方法。完整档案见 WorkBuddy-BenchE-Bench

WorkBuddy Bench(arXiv 2607.20911,四赛道 260 题,全开源)

腾讯编码助手 WorkBuddy 团队 + 安全实验室;题目、评分代码、参考答案全部开源。

赛道题数设计要点成绩亮点
代码80修 bug 仅 10 道,其余为功能/测试/算法/数据分析;带开发者/算法/PM/QA/运维五种角色口吻Claude Opus 4.8 领先
前端70硬约束”必须交付能跑的东西”:自动化评测实际点按钮、验证交互与刷新后数据持久化
办公50混合文件工作区,检查关联文件更新与副作用GPT-5.5 最高 86.05(一套环境)
安全6038 攻击 + 22 防御;确定性程序打分、全程不用大模型当裁判、五层反作弊GLM-5.2 两环境均第一(76.32 / 80.86)
  • 防背题设计(逆向改写):题目从真实代码提交记录、代码审查请求、安全漏洞逆向改写成口语化需求;改写后用任务描述反查搜索引擎确认搜不到原始出处。
  • 换执行环境排名就变:7 模型 × 2 套执行环境跑出 8 张成绩单;代码赛道变动最大,GPT-5.5 与 GLM-5.2 两套环境排名互换。

⚠️ 矛盾 [2026-08-10] 模型分数不是模型的固有属性,而是”模型 × 执行环境/工具链”的组合属性——与把 benchmark 分数当作模型绝对能力指标的常见用法冲突。详见 Agent 评测范式演变

E-Bench(arXiv 2607.23722,323 任务,环境不开源)

腾讯混元;王者荣耀 / QQ 音乐 / 腾讯会议三场景合成有状态平行世界(41 表 / 345 列 / 69 外键 / 7.6 万行 / 1,219 实体)。

  • 信息差 + 工具差:出题者全知(Claude Opus 4.7,可 SQL 查全库、执行代码、记录数据库变更作标准答案);解题者半盲(仅业务级工具,无循环/聚合/SQL)。三个强模型(GPT-5.5、Claude Opus 4.7、GLM-5.1)独立验证可解性,≥2 通过才收录。
  • 可靠性指标 Pass³:最强 Kimi-K3 总分 73.79%;Pass@3 87.62% vs Pass³ 仅 58.82%,目前无模型 Pass³ 超过 60%。
  • 代码执行改写排名:开放代码执行后 Claude Opus 4.8 68.78%→81.11% 登顶,反超 Kimi-K3(77.61%)与 GPT-5.5(77.19%);Gemini-3.5-Flash 第 9 冲至第 6(+47%)。
  • 成本统计:DeepSeek-V4-Pro 0.028 美元/任务(47.7%)vs Kimi-K3 0.634 美元/任务(73.8%)。
  • 场景难度:王者荣耀 43.64%(最难)< 腾讯会议 58.87% < QQ 音乐 61.39%(最易);极端任务需 13 轮对话、94 次工具调用完成 15 个数据库状态变更(HY-3 全对)。
  • 已知短板:环境为合成、与真实线上产品复杂度有差距;为防针对性训练环境和任务不开源;仅覆盖单产品内任务。

新增基准(2026-08-08 ~ 08-10 批次)

来源:评测日报 08-0808-0908-10

  • HarnessOpt-BenchScale AI,arXiv 2608.06301):首个系统评测”optimizer LLM 能否自动改好目标 agent 的 harness”的基准;held-out 分区 + TEE 隔离 + 版本审计,4 任务 × 5 模型 × 111 次计分运行。见 Agent Harness
  • GST-BenchByteDance Seed,arXiv 2608.05747):长时视频全局空间感知 VQA;最强 VLM 42.68 vs 人类 79.08;瓶颈在长时观测整合而非感知本身。
  • FinEvo-Bench(北航 + 阿里云通义点金,arXiv 2608.06144):首个纵向评测自进化 agent 的金融基准;120 任务 × 20 场景 × 6 领域,质量 + 合规双评。见 金融 AI
  • Skill²-Bench(Princeton,arXiv 2608.05139):9 领域 558 项技能的跨技能长程任务集;Skill Entropy 度量技能切换难度,“熵越高准确率越低”普遍成立;反向用作训练信号(Skill-Entropy RL)见 Qwen
  • PoolBench / EpiBench(08-08 日报入库):前者证明构造方法影响 ΔAUROC 0.15 ≫ pooling 选择 0.016;后者以受控采样抑制 shortcut。
  • IBM”给基准打质量分”(arXiv 2608.06329):reference-free 框架从一致性、复杂度、policy 覆盖度三维度给对话 agent 基准打质量分,与 SciCode-Verified 的人工专家审计路线构成自动化互补(见 基准失效的三种模式)。

新增基准与方法(2026-08-11 ~ 08-12 批次)

来源:评测日报 08-1108-12

  • SEE:科学多模态推理要求回答绑定可定位证据;最佳 MLLM 约 48.7%,加工具约 52.7%。重要性在于把“知道答案”与“能用证据支持答案”分开。
  • FinRank:SEC 文档金融 RAG,利用 source-sensitive hard negative 识别“答案正确但引错来源”;检索 Recall@10 约 44.8%,暴露检索瓶颈。
  • 长程轨迹归因:基于 1,300+ Trace 识别主要故障组件与传播链,补足只看最终分数的盲点。
  • A²E:联合审计 Agent、任务、平台/工具与监控器,强调“模型 × Harness”组合而非孤立模型排名。
  • SWE-Bench ProMax:170 个跨 7 语言重构任务,人工重写题面和双向审计测试;平均 11.4 文件/261.6 LOC,最佳 41.2%。仍需封堵运行时 git history/公网泄漏。
  • UNSPECIFIC:用相似参考样本抽取共享约束,再生成不同内容,打断复制参考答案捷径;同时评结果和约束总结。
  • TCS-Bench:2020–2026 FOCS/STOC/SODA 理论计算机科学证明;Verifier Agent 与专家对齐,但动态更新和污染仍需持续检查。
  • ComboShoppingBench:Witness-guided 任务生成确保可解,确定性硬约束与语义 Judge 混合评分。

方法收敛:2026-08-12 批次不再只追求“更难”,而是同时要求题面重写、可解性证据、测试双向审计、硬/软约束分离和污染/泄漏分层治理。

关联