一句话定位:竞赛数学里”模型还没做出来”的那批题组成的极限题集——MathArena(ETH Zurich SRI Lab + INSAIT)从近百场 2025 年竞赛中只筛出 12 道前沿模型 4 次尝试内做不出的题;“Apex Shortlist” 是 DeepSeek V4 系列发布材料中引用的对应短名单口径(同源 MathArena,见文末定义考证)。
为什么值得关注
- 反向选题逻辑:普通基准是”出题→测模型”,Apex 是”先测模型→只留没人做出来的”——GPT-5 在所有常规决赛卷已 ~90%,MathArena 干脆只收”未被征服”的题,发布时最强模型仅 5.2%
- 自动可验证的数学极限题(final-answer 格式),比证明题评测便宜得多,又比 AIME 类卷子难得多
- 与 humanitys-last-exam 同属”最后一个基准”设计哲学,但更窄更深(纯竞赛数学)
- DeepSeek V4 技术报告(arXiv:2606.19348)将其列为数学推理核心评测之一(引用 Balunović et al. 2025,MathArena 论文,NeurIPS Datasets & Benchmarks track)
评测集构成(Apex 主集,2025-08 发布)
| 项 | 说明 |
|---|---|
| 题量 | 12 道(初版);团队声明随新赛事持续扩充,保持动态防污染 |
| 来源 | 6 道来自 final-answer 竞赛(SMT/EMCC/CMM),6 道由证明题赛事(IMO/TST/ELMO Shortlist 等)改编为 final-answer 格式 |
| 筛选协议 | 候选题先用 Grok 4 / GPT-5 (High) / Gemini 2.5 Pro / GLM 4.5 各试 4 次,任何一次做对即淘汰;约 100 场竞赛只有 12 题通过——足见决赛卷对前沿模型的饱和程度 |
| 评测协议 | 每模型 16 次独立运行,报告平均成功率;“解出”分两个视角:小 k 内做对(实用视角,用于选题)vs 大 k 至少一次做对(极限能力视角,用于评测) |
| 发布时结果 | 最强 Qwen3-A22B-2507-Think 仅 5.2%(7/16 集中在最易的第 1 题);第 9-12 题所有模型 0 解 |
| 数据 | 题目公开(3 道 SMT 题因未获授权暂不公开);模型 traces 公开;部分题目发布前已在网上存在,团队用”选题决策早于部分模型发布”论证污染暂不构成问题 |
排行榜
模型分数见 apex-shortlist(MathArena 原始结果发布时最强仅 5.2%;DeepSeek V4 报告口径 Gemini 3.1 Pro 主集 60.9%、V4-Pro-Max Shortlist 90.2% 全场第一)。
⚠️ “Apex Shortlist” 定义考证
截至收录时(2026-08-13)没有找到 MathArena 或 DeepSeek 对 “Apex Shortlist” 的正式公开定义,已知事实与推断:
- DeepSeek V4 技术报告中 Apex 与 Apex Shortlist 两行引用同一参考文献(MathArena 论文)
- MathArena Apex 博客(2025-08-18)只定义了 12 题主集;其选题过程中的候选题池(近百场竞赛筛出的候选)和竞赛本身的 “shortlist”(如 ELMO Shortlist,Apex 题源之一)是两个可能的语义来源
- 从分数形态推断:Shortlist 集合比 Apex 主集更大且更易(72-90% vs 11-61%),最可能是”候选短名单”(含已被部分模型解出的题);Apex 主集则保持”未征服”定位
- 2025-08 发布时最强模型仅 5.2%,到 2026-04 DeepSeek 测时 Apex 主集最高已到 60.9%——说明主集已扩充/题目陆续被攻克,两行数据对应的题集规模未知
读法建议:引用时注明”DeepSeek 报告口径”;跨模型比较仅限同一张表内;不要与其他机构自测的 “Apex” 数字混比。
定性发现(MathArena 博客)
- 各模型常犯同样的错:同一题的最常见错误答案往往占 50%+ 尝试——共享的推理弱点
- 模型”懒且固执”:快速锁定一个(错的)直觉答案后全力自证,不回头找更优解;构造题上尤其明显
- 不确定性量化差:只有 GPT-5 偶尔明说”我给不出严格证明”
局限性
- 题量小(12 道起),单题对总分影响巨大;官方自己也说”不要从排名表下结论”
- Apex Shortlist 口径不透明(题集/评分器未公开)
- 纯 final-answer 竞赛数学,不代表证明能力(证明向看 IMO/USAMO 人工评)和工程能力
资源
- MathArena Apex 博客与逐题分析:https://matharena.ai/apex/
- MathArena 平台(竞赛榜单):https://matharena.ai/
- MathArena 论文:Balunović et al., MathArena: evaluating LLMs on uncontaminated math competitions, NeurIPS 2025 D&B track
- DeepSeek V4 技术报告(Apex/Apex Shortlist 出处):https://arxiv.org/abs/2606.19348
相关页面
- apex-shortlist — 本基准分数快照
- humanitys-last-exam — 同为”最后一个基准”设计哲学(广覆盖知识 vs 极限数学)
- codeforces — 竞赛编程 rating 口径(数学之外的另一条竞赛线)
- llm-vram-usage-calculation — DeepSeek-V4-Flash 显存计算页(V4 系列同族)