Endpoint Accuracy

核心命题:推理链路(endpoint / 输出 token 上限 / 工具调用解析 / 推理后端)是独立于模型权重的评测变量——同一份开源权重,在不同 serverless 供应商处的准确率最多可相差近一半。

证据链(三点连线)

  1. 8/7 日报:LMArena 注记”同模型不同 endpoint 分数不同”(NVIDIA Cosmos3 分数改为反映原生 endpoint)——首次以注记形式出现。
  2. 8/8 日报:待收录论文”推理后端影响评测可复现性”,与上述注记互为印证。
  3. 8/9 日报Artificial Analysis 推出 Endpoint Accuracy Index,把该现象产品化为指数——从注记升级为系统性计量。

Endpoint Accuracy Index 设计

  • 自建参考部署(官方权重 + 推荐精度)记 100%,各 endpoint 按相对百分比计分。
  • 三子项等权:BFCL-500(×3)、HLE-250(×10)、AA-LCR-25(×10)。
  • 首批覆盖 GLM-5.2、gpt-oss-120b、DeepSeek V4 Pro:
    • GLM-5.2 输出 token 上限最严的 endpoint 在 HLE-250 上只剩参考值一半或更低——推理被截断;
    • gpt-oss-120b 某些 endpoint 因工具调用解析差异,BFCL-500 仅 22%(参考 37%);
    • 低分 endpoint 普遍输出 token 数约为参考一半。

含义

  • 评测元数据应把 endpoint / 推理配置列为一等字段:模型名 + 权重版本不足以定义一次评测,供应商、token 上限、解析实现都必须记录。
  • 采购与选型时”同一个模型”在不同供应商处是不同的产品;对照 Floatboat 计量的 HLR 结论——模型权重之外的工程层(harness / 推理链路)都是独立变量。
  • Agent Harness 共同指向:“Model + Harness/Endpoint = Agent”等式中右半边长期无人报数的空白正在被填上。

关联