AI 评测行业
基于 AI 评测行业深度研究报告(2026-08,25 页,部分内容 AI 生成)建立的产业坐标系。核心判断:AI 评测行业正处于范式转换临界点——从”模型研发阶段的跑分竞赛”转向”生产部署阶段的动态对抗验证 + 合规背书”。
市场规模与口径
- GII 口径:2025 年 18.6 亿美元 → 2026 年 23.6 亿美元,CAGR 27.3%。
- 报告中性估计:2026 年全球广义市场约 25–30 亿美元(中性值约 28 亿,纯软件工具占 40–50%),2031 年约 80–100 亿美元。
- 口径泡沫:通用评测工具层的 TAM 把数据标注、合规咨询收入计入”评测”,难有独立护城河。
四阵营格局(CR5 < 40%)
| 阵营 | 代表 | 特点 |
|---|---|---|
| 学术/开源 | [[wiki/entities/OpenCompass | OpenCompass]]、HELM、LMSYS、SuperCLUE |
| 大模型/云厂商内置 | 各模型厂自建 evals | 绑定自家模型生态 |
| 独立商业平台 | [[wiki/entities/LangSmith | LangSmith]]、[[wiki/entities/Arize-AI |
| 安全合规服务 | [[wiki/entities/Scale-AI | Scale AI]]、NCC Group、Trail of Bits、HiddenLayer |
利润迁移:向三个高壁垒环节集中——安全合规评估与红队测试、垂直行业认证(医疗/金融/法律,客单价可达通用工具 5–10 倍)、动态对抗评测技术。到 2031 年安全评估 + 合规认证收入占比可能从 30–35% 升至 50% 以上。
终局判断
“几家合规认证寡头 + 大量垂直细分工具 + 开源底座”——不会出现一家通吃的平台。客户付钱买的不是评测动作,而是放心(合规背书 + 生产可靠性);买方从研发团队变为合规/风控/业务部门。
政策驱动力(最确定)
- 中国备案制(2023-07《生成式 AI 服务管理暂行办法》+ TC260 安全基本要求,31 种安全风险)已创造刚性预算;中国大模型安全评估 2026 年预计 35 亿元(+87%)。
- 欧盟 AI 法案高风险条款 2027-12 生效后集中释放;美国 2026-06 行政令转向自愿框架。
- 政策创造的是”合规评估”预算而非”通用工具”预算。详见 AI 安全。
估值锚点与高管变动
- Scale AI:2025 年 Meta 以 143 亿美元投资 49% 股份、估值 290 亿美元;Alexandr Wang 离职加入 Meta 任首席 AI 官。
- LangChain / LangSmith:2026-08 融资 1.25 亿美元、估值 12.5 亿美元(IVP 领投)。
⚠️ 矛盾 [2026-08-10] 报告数据源质量参差:57 分落差锚点引自个人博客(baeseokjae.github.io)、MMLU 污染率引自日文博客、Scale AI / LangChain 估值引自投资类内容站——头部数字转引前需独立验证。另:报告把静态基准失效笼统归因于”数据污染”并统一开”动态对抗”药方,但失效至少有三种机制(题目质量缺陷 / 数据污染 / 测量工具不可靠),辨析见 基准失效的三种模式。
三大趋势与验证信号
- 静态公开基准 → 私有动态题库 + 对抗性测试(见 动态对抗评测);
- 研发工具 → 合规驱动的生产基础设施;
- 通用评测商品化 → 垂直场景方案。
报告配套 T1–T7 信号验证清单与三情景推演(中性情景概率 50–60%)。
[2026-08-12] 工具市场不是一个品类
2026 LLM 评测工具全景 提供了更实用的产品分层:
| 层 | 用户问题 | 代表类别 |
|---|---|---|
| Trace / Debug | 这次运行发生了什么? | Weave、LangSmith、Langfuse |
| Systematic Eval | 版本是否达标、是否退化? | DeepEval、Deepchecks、评测数据集与 Judge |
| Production Monitoring | 线上分布和风险是否变化? | Helicone、Phoenix、Datadog 类监控 |
| Governance / Security | 能否审计、红队与合规? | Giskard、模型/数据注册表、安全评估 |
这说明“评测平台”市场存在相邻但不同的预算所有者:研发买调试与回归,平台团队买可观测与监控,风控/合规买审计和治理。单一工具可能跨层,但不能用一个离线分数替代生产监控或合规背书。
? 该 Medium 文章带明显工具选型和厂商偏好,且价格/功能会快速变化;本页只吸收分类结构,不接受“最佳工具”排序。