Humanity’s Last Exam

由 AI 安全研究所(CAIS)联合 Scale AI 于 2025 年初发布的前沿能力评测基准,汇集数百道跨学科专家级高难度题目,用于探测大模型能力上限,当前前沿模型得分普遍很低。Artificial Analysis 将其纳入模型评测套件(与 MMLU-Pro、GPQA Diamond、LiveCodeBench 等并列)。

关联