WorkBuddy Bench

腾讯编码助手 WorkBuddy 团队联合安全实验室发布的安全 + 编码 Agent 评测基准(2026-07-24,arXiv 2607.20911):四赛道 260 题,题目、评分代码、参考答案全部开源。姊妹基准:E-Bench

四赛道(260 题)

赛道题数设计要点成绩亮点
代码80修 bug 仅 10 道,其余为功能/测试/算法/数据分析;带开发者/算法/PM/QA/运维五种角色口吻Claude Opus 4.8 领先
前端70硬约束”必须交付能跑的东西”:自动化评测实际点按钮、验证交互与刷新后数据持久化
办公50混合文件工作区,检查关联文件更新与副作用[[wiki/entities/ChatGPT-5.5
安全6038 攻击 + 22 防御;确定性程序打分、五层反作弊[[wiki/entities/GLM-5

设计亮点

  • 逆向改写防背题:题目从真实代码提交记录、代码审查请求、安全漏洞逆向改写成口语化需求;改写后用任务描述反查搜索引擎确认搜不到原始出处——从出题方式上防”背题”(防数据污染的题目侧手段,对照 动态对抗评测)。
  • 全程不用大模型当裁判:确定性程序打分 + 五层反作弊——是 LLM-as-Judge 可靠性争论中的对照立场。
  • 换执行环境排名就变:7 模型 × 2 套执行环境 = 8 张成绩单;代码赛道变动最大,GPT-5.5 与 GLM-5.2 两套环境排名互换。

⚠️ 矛盾 [2026-08-10] 分数是”模型 × 执行环境”的组合属性而非模型固有属性——安全赛道 GLM-5.2 两环境 76.32 / 80.86 均第一,但代码赛道排名随环境互换。

已知短板(论文自述)

代码赛道以 Python 为主、跨语言覆盖有限;办公赛道不涉及 OCR 与 GUI 操作;Claude Opus 4.8 在代码赛道有一组使用了修改过的指令配置(与其他模型跑法不完全一致)。

关联