Artificial Analysis
独立 AI 评测机构,维护 Intelligence Index(智能指数)等公开榜单,2026-08 进一步把”推理链路”变成独立评测对象。
Intelligence Index
- v4.1.1(2026-07):整体变动 <1 分,Claude Opus 5 以 63 分居首;τ³-Banking 修正 unhappy-path 恢复轨迹误判。
- 自 v4.1.1 起,HLE / AA-LCR / AA-Omniscience 判分统一由 GPT-5.6 Luna(medium)担任,替换原先的 GPT-4o / Qwen3 235B / Gemini 3 Flash Preview——grader 换模型即分数微涨,再次印证 judge 测量效度问题(见 LLM-as-Judge)。
- 历史口径:Kimi-K3 智能指数 57 分(2026-07,第三)。SciCode 曾被纳入智能指数评测套件——SciCode-Verified 修正 263 处缺陷后旧分数失效(见 基准失效的三种模式)。
Endpoint Accuracy Index(2026-08 推出)
把”同一份开源权重在不同 serverless 供应商处的准确率”产品化为指数,详见 Endpoint Accuracy:
- 自建参考部署(官方权重 + 推荐精度)记 100%,各 endpoint 按相对百分比计分;三子项等权:BFCL-500(×3)、HLE-250(×10)、AA-LCR-25(×10)。
- 首批覆盖 GLM-5.2、gpt-oss-120b、DeepSeek V4 Pro:GLM-5.2 输出 token 上限最严的 endpoint 在 HLE-250 上只剩参考值一半或更低(推理被截断);gpt-oss-120b 某些 endpoint 因工具调用解析差异 BFCL-500 仅 22%(参考 37%)。