GPT-5.6 Luna
OpenAI GPT-5.6 系列的经济档模型,2026-07-31 API 降价 80%(输入 0.2 / 输出 1.2 每百万 token)。据 OpenAI 自述(未独立审计),其综合能力对标一年前顶尖模型、成本仅 6%、推理速度快 9 倍,并被设为多个自动化场景的默认模型;Replit、Ramp 等给出正面实测反馈。
[2026-08-10] 起任 Artificial Analysis 统一判分模型
自 AA Intelligence Index v4.1.1(2026-07)起,HLE / AA-LCR / AA-Omniscience 三项判分统一由 GPT-5.6 Luna(medium)担任,替换原先的 GPT-4o / Qwen3 235B / Gemini 3 Flash Preview;同期 τ³-Banking 修正了 unhappy-path 恢复轨迹误判。整体指数变动 <1 分,Claude Opus 5 以 63 分保持第一——grader 换模型即分数微涨,再次印证 LLM judge 的测量效度问题。见 LLM-as-Judge 证据链。
来源:评测日报 08-09;机构见 Artificial Analysis。