本页列出所有已收录榜单:官方链接 + 简洁介绍 + 当前榜首。榜单是快照,会过时;分数以各官方站实时为准。评测维度说明见 benchmarks。

编码 / 软件工程

  • SWE-bench Verified — 官方榜:https://www.swebench.com/ | wiki 快照:swe-bench-verified coding agent 事实标准榜,180 条提交。Claude 4.5 Opus 79.2% 榜首;官方默认视图是 Bash-Only(统一 mini-SWE-agent),同分下成本差 10x
  • Multi-SWE-bench — 官方榜:https://multi-swe-bench.github.io/ | wiki 快照:multi-swe-bench 多语言 issue 修复榜(7 语言 1,632 题,按语言切榜)。论文时代非 Python 语言仅 5–23%,2026 社区提交把 C 推到 54.3%、Java 47.9%、C++ 47.3%;分母漂移,引用须写 resolved/total
  • Vibe Code Bench — 官方榜:https://www.vals.ai/benchmarks/vibe-code | wiki 快照:vibe-code-bench 从零建应用榜,79 个模型配置。Claude Fable 5 90.35% 榜首,半年内榜首从 41.31% 翻倍;Kimi K3 是首个进第一梯队的开源权重
  • DeepSWE — 官方榜:https://deepswe.datacurve.ai/ | wiki 快照:deepswe 长时域原创 SWE 榜,23 模型统一 mini-swe-agent。Claude Opus 5 74% 榜首;网站提供成本×分数散点图,DeepSeek V4 Pro 11.84 差 360x
  • DSBench-FullStack — 无公开榜(DeepSeek 发布材料口径)| wiki 快照:dsbench-fullstack DeepSeek 内部全栈测试集分数表:Opus 4.8 71.6 > V4-Flash 68.7;V4-Pro 正式版 71.1。仅当方向信号读

终端 / 工具使用(Agent 执行)

  • Terminal-Bench — 官方榜:https://www.tbench.ai/leaderboard/terminal-bench/2.1 | wiki 快照:terminal-bench 终端任务榜,20 条提交。Claude Fable 5 + Claude Code 83.8% 榜首;独有 reward hacks 列(Grok 4.5 高达 -9%),纯看 accuracy 会误判
  • Toolathlon — 官方榜:https://toolathlon.xyz/ | wiki 快照:toolathlon 跨应用工具使用榜。Kimi K3 76.5% 登顶(开源权重第一),8 个月前论文时点 SOTA 仅 38.6%;Pass^3 一致性仅 68.5%
  • DuMateBench — 官方榜:https://dumatebench.com/leaderboard | wiki 快照:dumatebench 真实办公交付榜(200 题 / 5 harness × 4 模型 / F = 0.3P + 0.7J)。默认视图是 base model = GPT-5.5,不是全模型平均;Opus-4.8 换 harness 分差可达 27 分。当前榜首 DuMate 81.5%,OpenCode 69.1%

知识 / 推理

  • Humanity’s Last Exam — 官方站 lastexam.org 目前不可达,第三方追踪:https://benchlm.ai/benchmarks/hle | wiki 快照:humanitys-last-exam 三口径并存:带工具 agent Claude Opus 5 64.7% / 闭卷 AA 方法 Gemini 3.1 Pro 44.7% / 历史 SOTA 线。口径差 20+ 分,引用必须带协议
  • Apex Shortlist — 原始出处:https://matharena.ai/apex/ | wiki 快照:apex-shortlist 极限数学榜。MathArena 原始口径发布时最强仅 5.2%;DeepSeek V4 报告口径 Gemini 3.1 Pro 主集 60.9%、V4-Pro-Max Shortlist 90.2% 第一。Shortlist 定义未公开

竞赛 rating

  • Codeforces rating — 无统一官方榜(厂商各自报告)| wiki 快照:codeforces 进展时间线:AlphaCode 2 ≈人类前 15%(2023-12)→ Gemini 3 Pro 3455 人类 Top 10(2025-11)→ DeepSeek V4 / GPT-5.4 3206 现役第 23(2026-04)。各报告方协议不一,跨厂商数字先问口径

中文向

  • SuperCLUE — 官方榜:https://www.superclueai.com/homepage | wiki 快照:superclue 中文综合月度榜(0-100 加权)。2026-07 期 Qwen3.8-Max 71.48 登顶、Kimi K3 70.68 第二;月榜波动大(题库每两月全换),与英文基准分数不可比

读榜通则

  1. 先看口径(harness/工具/判分方式),再看数字
  2. 分数是快照:以官方站实时数据为准,wiki 快照只留历史截面
  3. 跨榜排名不迁移是常态(同一模型在不同榜相对位置差异巨大)
  4. 成本/轮数/reward hacks 是与 accuracy 同等重要的列

相关

  • benchmarks — 所有评测集总览(评测维度)