CursorBench
Cursor 自建的内部基准,用于评估前沿模型处理长期、真实世界工程问题的能力。由 Cursor 评估与模型行为研究负责人 Nate Schmidt 团队维护。Cursor 因同时支持所有主流前沿模型与自研模型,成为评估各模型实际性能的”异常中立的裁判”。
设计动机
公开基准测试分数与开发者对模型的真实接受度已不再吻合,因此 Cursor 构建了自己的评估体系。CursorBench 刻意还原工程师实际提示模型时那种混乱、定义不明确的方式:
- 堆栈跟踪 + 一个”修复”:只粘贴一段堆栈跟踪附一个单词,模型必须自行推断意图、找到根本原因并验证修改。
- 错误模块诱导:故意告诉模型错误的模块有问题,测试模型是会质疑用户假设,还是顺着假设走进死胡同。
评估哲学
- 正确答案只是基本门槛,真正评估的是”模型是否理解了被问的问题”。
- 真实用户提示不是”定义明确的问题 + 约束条件”,模型必须:推断用户有问题及其意图 → 识别根因 → 修复 → 验证修复 → 汇报。
- 对高分模型保持怀疑(“要么非常聪明,要么在作弊”),通过查看追踪记录、阅读最难任务上的实际推理过程来核验。
- 同时关注 token 效率:相对完成的工作量,token 使用是否高效。
已知结果
| 模型 | 模式 | 得分 | 备注 |
|---|---|---|---|
| Claude Fable 5 | 最大努力 | 72.9% | 创历史新高(2026-07-17) |
衍生观察(Schmidt)
- 局部推理 vs 全局推理:“登陆月球”测试中,Opus 做局部推理(思考刚发生/即将发生什么,12–16 小时无果);Fable 5 做全局推理(思考整个任务,先入轨收集遥测再迭代,数小时着陆)。
- 模型选择启发式:A→B 路径清晰 → 不需要 Fable;身处 A 但不知 B 在哪 → Fable 是绝佳选择。优化目标是”解题时间”。
Notes
- CursorBench 为 Cursor 单方内部基准,无第三方复现;与 Artificial Analysis 等第三方智能指数方法论不同,跨基准分数不可直接通约。
Related: Cursor | Claude-Fable | AI-Agent-Evaluation | AI-Model-Competition