CursorBench

Cursor 自建的内部基准,用于评估前沿模型处理长期、真实世界工程问题的能力。由 Cursor 评估与模型行为研究负责人 Nate Schmidt 团队维护。Cursor 因同时支持所有主流前沿模型与自研模型,成为评估各模型实际性能的”异常中立的裁判”。

设计动机

公开基准测试分数与开发者对模型的真实接受度已不再吻合,因此 Cursor 构建了自己的评估体系。CursorBench 刻意还原工程师实际提示模型时那种混乱、定义不明确的方式:

  • 堆栈跟踪 + 一个”修复”:只粘贴一段堆栈跟踪附一个单词,模型必须自行推断意图、找到根本原因并验证修改。
  • 错误模块诱导:故意告诉模型错误的模块有问题,测试模型是会质疑用户假设,还是顺着假设走进死胡同。

评估哲学

  • 正确答案只是基本门槛,真正评估的是”模型是否理解了被问的问题”。
  • 真实用户提示不是”定义明确的问题 + 约束条件”,模型必须:推断用户有问题及其意图 → 识别根因 → 修复 → 验证修复 → 汇报。
  • 对高分模型保持怀疑(“要么非常聪明,要么在作弊”),通过查看追踪记录、阅读最难任务上的实际推理过程来核验。
  • 同时关注 token 效率:相对完成的工作量,token 使用是否高效。

已知结果

模型模式得分备注
Claude Fable 5最大努力72.9%创历史新高(2026-07-17)

衍生观察(Schmidt)

  • 局部推理 vs 全局推理:“登陆月球”测试中,Opus 做局部推理(思考刚发生/即将发生什么,12–16 小时无果);Fable 5 做全局推理(思考整个任务,先入轨收集遥测再迭代,数小时着陆)。
  • 模型选择启发式:A→B 路径清晰 → 不需要 Fable;身处 A 但不知 B 在哪 → Fable 是绝佳选择。优化目标是”解题时间”。

Notes

  • CursorBench 为 Cursor 单方内部基准,无第三方复现;与 Artificial Analysis 等第三方智能指数方法论不同,跨基准分数不可直接通约。

Related: Cursor | Claude-Fable | AI-Agent-Evaluation | AI-Model-Competition