Evals
Evals(评估)是对 AI 模型与 Agent 能力进行系统性度量与基准测试的方法论。在 Agent 时代,evals 不再局限于静态问答准确率,而转向衡量任务完成的确定性、可重复性与端到端交付质量——即”度量衡”。缺乏可靠 evals 的 Agent 在无人值守场景下偏离会随执行时长放大,因此可观察的成功标准与护栏成为关键。
美团图灵评测实践:观测 + 评测 = 持续迭代(2026-08-07)
来源:Agent 评测漫谈(美团图灵 Agent 评测团队)。
- Agent 研发公式:观测 + 评测 = 持续迭代。评测是 Agent 效果的”精密量具”,必须服务于真实业务中的研发、上线、回归、优化与规模化落地,不能停留在离线打榜或单次 Demo。
- 评测链路五环节:采集(线上/沙箱原始任务)→ 清洗(去重、归类、补上下文、修复脏数据)→ 评测(人工 + AI)→ 质检(标准是否稳定、结果是否可信)→ 分析/归因(定位问题、形成优化建议与回归任务);与线上 AB、持续观测共同构成数据飞轮。
- 评测是实践科学:起步阶段”让数据飞轮高效运转”的意义远大于”设计复杂精妙的评测体系”;体系靠 Good/Bad Case 喂养(Bad Case 暴露能力边界,Good Case 定义”好”的范式)。
- 客观/主观并行:客观评测覆盖高频、结构化、可规则化部分;主观评测覆盖开放性、高价值、复杂场景;用主观评测校准客观评测与 AI 评测,再把规模化交给自动化。
- 完整方法论(四层评测、桥梁指标、人人/人机一致、长程 Agent 的 Task 评测)见 AI Agent Evaluation。
[2026-08-10] 产业坐标:评测的市场结构与利润迁移
来源:AI 评测行业深度研究报告。详见 AI 评测行业。
- 市场规模:GII 口径 2025 年 18.6 亿美元 → 2026 年 23.6 亿美元(CAGR 27.3%);报告中性估计 2026 年全球广义评测市场约 25–30 亿美元(中性值约 28 亿,纯软件工具占 40–50%),2031 年约 80–100 亿美元。
- 利润迁移:通用评测工具层 TAM 存在口径泡沫(数据标注、合规咨询收入被计入”评测”),难有独立护城河;利润向三个高壁垒环节集中——安全合规评估与红队测试、垂直行业认证、动态对抗评测技术。
- 终局判断:“几家合规认证寡头 + 大量垂直细分工具 + 开源底座”,不会出现一家通吃的平台。
- 最确定驱动力是政策:中国备案制已创造刚性预算;欧盟 AI 法案高风险条款 2027-12 生效;买方正从研发团队变为合规/风控/业务部门。
[2026-08-10] 基准有效性危机的量化锚点
- 题目质量缺陷:SciCode-Verified(arXiv 2608.04975)——专家逐题审计 SciCode 全部 65 题,发现 263 处缺陷(192 处会把正确解误判为错误,分布在 91% 的主问题上;78% 的压分缺陷需专业物理/数学知识才能识别),修正后子问题准确率 45–60%→84–98%(约 +39pp)、主问题 9–27%→69–92%,审计轨迹开源。来源:评测日报 08-08。
- 数据污染:SWE-bench Verified 约 80% 的模型在防污染 Pro 版仅约 23%,落差 57 个百分点;MMLU 整体污染率约 13.8%(哲学领域最高 66.7%);HumanEval 87% 的模型存在超 30% 污染率(行业报告口径,数据源质量见下)。
- 测量工具不可靠:单 judge 忠实度自我一致性 kappa 仅 0.137、41% 判决翻转(08-10 日报);同一份权重在不同 endpoint 准确率相差近一半(08-09 日报,见 Endpoint Accuracy)。
⚠️ 矛盾 [2026-08-10] SciCode 上”科学编程能力停滞/饱和”的论点(近一年被多方引用)被 SciCode-Verified 证伪——分数平台期是 263 处基准缺陷所致,不是模型能力所致;所有引用 SciCode 旧分数的对比结论应标记待复核。另:行业报告把三种机制不同的静态基准失效混为”数据污染”并统一开”动态对抗”药方,辨析见 基准失效的三种模式。
? 行业报告头部数字的引用质量参差:57 分落差锚点引自个人博客(baeseokjae.github.io)、MMLU 污染率引自日文博客、Scale AI / LangChain 估值引自投资类内容站——转引前需独立验证。
[2026-08-10] Floatboat:五项第三方 Agent 基准的设计要点
来源:Floatboat Harness 首次计量五项基准全胜。
- BrowseComp(OpenAI 官方出品):Floatboat Harness + DeepSeek-V4-Flash 得 87.80,超 GPT-5.6 Terra 87.5 / Claude Sonnet 5 84.7 / Opus 4.8 84.3 / GPT-5.6 Luna 83.3。
- DeepSWE:使用 113 个完全未泄漏的代码库(防污染设计,与 动态对抗评测 方向一致)。
- AutomationBench:在 47 个 SaaS、近 500 个 API 端点间穿行。
- 同一 DeepSeek-V4-Flash 底座:在 DeepSeek 官方 Harness 上对 Opus 4.8 一项没赢(DeepSWE 54.4 vs 58.0),接入 Floatboat Harness 后五项全胜(DeepSWE 67.25)——Harness 是独立于模型权重的评测变量,HLR 计量见 Agent Harness。
[2026-08-10] 其他新增
- AIHOT 共识榜 LatentRank:以 Bradley-Terry 成对比较 + 先验约束 + 冻结锚点模型,把 10 个排行榜聚合为归一 100 分制的共识分——对”榜单太多该信谁”的建设性回答(对照 古德哈特定律源页)。来源:AIHOT 模型共识榜。
- 因果推断归因分析(淘天):评测从”发生了什么”走向”为什么发生”——组件级贡献度量化(Trace 归因 / 扰动式归因 / PSM·DML 净效应),见 源页 与 AI Agent Evaluation。