一句话定位:CAIS(Center for AI Safety)× Scale AI 出品的”人类知识前沿终极闭卷考”——2,500 道由全球学科专家命制、连专家都觉得难的研究生级以上题目(多选+简答、含多模态),设计初衷是成为”最后一个”广覆盖闭卷学术基准,因为命题时要求专家出”当前 AI 还答不上的题”。

为什么值得关注

  • 难度天花板设计:MMLU 等已被刷到 90%+ 饱和,HLE 专门收集 frontier 模型答不出的题,2025-01 发布时最强模型仅个位数百分比(~8%),一年半后到 ~65%,是观察”知识+推理前沿”进展的主刻度
  • 覆盖几十个学科:数学占比最大,其余物理/化学/生物/计算机/哲学/历史/音乐/古典学/经济学等;不少题带图像(多模态)
  • 自动可判分:每题有明确无歧义、可快速验证的答案,且”不能靠检索直接搜到”
  • 口径混乱是 HLE 的最大看点:同一模型不同评测协议相差 20+ 分(详见下文),读任何 HLE 数字必须先问清口径

评测集构成

项说明
题量2,500(论文口径;部分第三方追踪站记 3,000,含扩展题)
题型多选题 + 简答题(自动判分:精确匹配或 LLM judge)
命题全球 subject-matter experts 众筹命制,每题有已知唯一解;要求”互联网检索不能快速得出”
发布2025-01 首发(arXiv:2501.14249,持续修订至 2026-07 v11);官方站 lastexam.org(2026-08 抓取时 DNS 无法解析,权威官方榜暂不可达)

排行榜

模型分数见 humanitys-last-exam(三套口径并存:带工具 agent / 闭卷 AA 方法 / 历史 SOTA,口径差 ~20 分,引用必须带协议说明)。

数据质量争议:HLE-Verified

社区分析发现 HLE 含相当比例噪声题(题面或参考答案有误),会系统性压低分数并扭曲跨模型对比。HLE-Verified(arXiv:2602.13964)做了两阶段验证-修复:

  • 668 题通过专家+模型交叉验证(verified)
  • 1,143 题经双独立专家修复后认证(revised)
  • 689 题存疑,带不确定性标注开放
  • 8 个 SOTA 模型复测:HLE-Verified 上平均高 7-10 个百分点,原题有误的子集上高 30-40 个百分点;且”模型越不自信的题越可能是题目本身有错”

局限

  • 闭卷学术问答形态,不代表 agent/实操能力(与 swe-bench-verified、terminal-bench 互补);公开题有训练污染风险(官方榜单依赖非公开题);官方站不可达导致权威口径缺位,第三方榜单各说各话

资源

相关页面