评测口径说明见 codeforces。本页只放分数:各模型竞赛编程能力强度(注意:均为报告方口径,协议不一)。
进展时间线(均为报告方口径)
| 时间 | 模型 | CF Rating / 百分位 | 来源与备注 |
|---|---|---|---|
| 2023-12 | AlphaCode 2 | ≈人类前 15% | DeepMind 模拟参赛估计 |
| 2024-12 | o1 | 89 百分位(内部评测 ~1791) | OpenAI 发布材料 |
| 2025-01 | DeepSeek R1 | 2029(超 96.3% 人类) | DeepSeek 技术报告;同报告 o1-1217 为 2061 |
| 2025-01 | o3-mini (high) | 2037 | OpenAI,CodeforcesEval |
| 2025-08 | GPT-5 (high) | 2721 | OpenAI 报告;第三方复测另有 2537 口径 |
| 2025-10 | DeepSeek V3.2 / Speciale | 2386 / 2701 | DeepSeek(Speciale 达人类大师级) |
| 2025-11 | Gemini 3 Pro | 3455(人类 Top 10,仅 7 人能赢) | Google 模型卡 |
| 2026-04 | DeepSeek V4 / GPT-5.4 | 3206(并列,人类现役第 23 位) | DeepSeek 发布口径 |
注意矛盾点:Gemini 3.0 Pro(2025-11)3455 > GPT-5.4(2026-04)3206,时间上”后来者反而更低”——这正是协议差异(采样次数/场次/判题口径)大于能力差异的典型例子。读任何 CF rating 先问协议。
衍生评测集当前榜首
| 评测集 | 榜首 | 分数 | 备注 |
|---|---|---|---|
| LiveCodeBench Pro | Gemini 3 Deep Think | 81.6% | 其后 Gemini 3.1 Pro Preview 75.5%、GPT-5.2-high 53.1%(断崖明显) |
| LiveCodeBench v6 | Sakana Fugu-Ultra | 93.2% | benchlm 快照,16 模型 |
分数观察
- rating 是协议敏感指标:同一模型不同采样/提交协议差几百分;厂商自选口径数字当宣传看,横向比要用同一评测框架
- 竞赛编程 ≠ 软件工程:CF rating 与 SWE-bench/Terminal-Bench 排名不迁移——它测算法设计与深度推理,不是工程交付
- 头部已进入人类 Legendary GM 区间(3455),该指标对 frontier 的区分度在下降,各家开始转向 LiveCodeBench Pro / 奥赛级题目