Claude Opus 5

Anthropic 于 2026-07-24 发布的旗舰模型,定位面向长期智能体任务、编程与专业工作。是本批次 4 个源页面共同锚定的核心实体。

规格

  • API Model ID:claude-opus-5;输入 5 / 输出 25 每百万 token;Fast mode 10/50。
  • 1M 上下文;同步最大输出 128K、Batch 300K(Beta);可靠知识截止 2026 年 5 月底。
  • 默认 effort high(档位 low/medium/high/xhigh/max);Thinking 默认开启且 xhigh/max 不可关闭。

基准(max effort,相对 Opus 4.8)

  • ARC-AGI-3 +28.7pp(1.5→30.2)、FrontierBench v0.1 +24.6pp(18.7→43.3)、SWE-bench Multimodal +21.0pp(38.4→59.4)、ARC-AGI-2 +18.3pp、OSWorld 2.0 +14.9pp。
  • Artificial Analysis Intelligence Index v4.1:Opus 5=61(Fable 5=60、GPT-5.6 Sol=59、Opus 4.8=56)。
  • Vals.ai SWE-bench Verified 500 任务:Opus 5=97.0%(GPT-5.6 Sol 96.2%、Fable 5 95.0%)。
  • 综合评测 8.8/10(评测报告)。

失败模式与安全

  • 四类失败模式:过度自信与撤回、自我修正循环、范围蔓延、审批门绕过(System Card 案例:把”clean up”解释为删除授权、删了 120 个任务)。
  • 风险重点已从”不会做”转向”过度自主”。
  • 泄露的系统提示词(CL4R1T4S)披露 fable_safeguards_routing:Fable 5 网络安全请求转交 Opus 4.8、生物学请求转交 Opus 5;产品矩阵含 Mythos 模型与 Project Glasswing(未经 Anthropic 确认)。

关联

  • Thariq 团队据此删 80% 系统提示词无评测损失(上下文工程新规)——Opus 5/Fable 5 代际判断力跃迁是”少规则”范式的前提。
  • “全场最强”只在部分任务成立:SWE-bench Pro 上 Fable 5(80.0) > Opus 5(79.2);DeepSWE v1.1 上 GPT-5.6 Sol(72.7) > Opus 5(68.8)。

部分数据为发布日公开证据/泄露文件转述,未经独立审计;泄露提示词真伪未确认。

[2026-08-10] Floatboat 五项基准:前代 Opus 4.8 全输给便宜模型 + Harness

来源:贵 57.1 倍的 Claude Opus 4.8 五项全输,赢它的不是模型,是 Harness(机器之心,2026-08-08;AOE Tech Labs 自报数据)。

  • 2026-08-07,AOE Tech Labs 在五项第三方 Agent 基准(DeepSWE、Terminal Bench 2.1、Toolathlon、BrowseComp、AutomationBench)公布完整评测:混合价 0.175/M** 的 DeepSeek-V4-Flash + Floatboat Harness,五项成绩全部超过混合价 **10/M、贵 57.1 倍Claude Opus 4.8(本实体 Opus 5 的前代基线)。
  • 单变量设计:同一 DeepSeek-V4-Flash 跑在 DeepSeek 官方自己的 Harness 上对 Opus 4.8 一项没赢(DeepSWE 54.4 vs 58.0),接入 Floatboat Harness 后五项全胜(DeepSWE 67.25)——模型权重与单位成本不变,唯一变量是 Harness。
  • Terminal Bench 打平:Opus 4.8 公开成绩与 DeepSeek 官方 Harness 在这一项完全打平 82.7:82.7——“升级到贵 57.1 倍的旗舰”在这一项零收益。
  • HLR 候选参照区间:按事先声明的规则,Terminal Bench 项兜底取最便宜有效参照 GPT-5.6 Luna(84.7,贵 2.6×)得 0.78×,并公开全部候选参照区间 0.26×~1.42×(Opus 5 亦出现在该区间的候选参照中,对应 1.42×)——规则先定、不许择优。

⚠️ 矛盾 [2026-08-10] 该数据与”贵旗舰 = 强 Agent”的普遍叙事冲突;但全部数据为厂商自报、尚无第三方复现,HLR 为本次新提出指标而非行业标准,换参照系统数值会变。采信时保持”可复算但未被复算”状态。详见 Harness 的计量与落地:双星分析