本页列出所有已收录评测集,每个只讲核心功能(评测什么、怎么评)。各模型分数见 leaderboards;深度内容在各自详情页。
编码 / 软件工程
- SWE-bench Verified — coding agent 事实标准。SWE-bench 2294 道真实 GitHub issue 经人工筛出 500 道;模型产 patch,沙箱跑 FAIL_TO_PASS/PASS_TO_PASS 测试计分。另有 Bash-Only 视图把所有模型放进同一个 mini-SWE-agent,分离”模型能力”与”harness 工程”
- Multi-SWE-bench — 多语言 issue 修复。1,632 道真实 GitHub issue(Java/TS/JS/Go/Rust/C/C++),39 仓库、68 名专家双标注,按人类耗时分级;三 scaffold(Agentless/SWE-agent/OpenHands)+ 自研 agent 都可交。唯一按语言切榜、公司可自助提交的多语言榜,但无防污染设计
- Vibe Code Bench — 从零建完整 Web 应用。给一页自然语言 spec(配 20-60 条测试),模型在 OpenHands 容器环境(Supabase/Stripe/MailHog,5 小时/1000 轮)里交付应用,Browser Use agent 做 point-and-click 端到端判分。专有数据集
- DeepSWE — 防饱和的长时域 SWE 基准。113 道全新原创任务(非改编现有 PR,防训练污染)、91 仓库 5 语言;统一 mini-swe-agent;隔离容器判 committed diff 防钻空子。prompt 半长但解答代码量 5.5x
- DSBench-FullStack — DeepSeek 内部全栈开发测试集(非公开,无题目/验证器)。观察 DeepSeek 后训练方向的信号,不是外部排名依据;姊妹集 DSBench-Hard
终端 / 工具使用(Agent 执行)
- Terminal-Bench — 终端环境真实工作流任务。89 道容器任务(编内核、配 git 服务器、破 7z……),每题独立环境+人工解法+自动验证;显式追踪 reward hacking 扣分。Harbor 框架运行,提交数据全开源
- Toolathlon — 跨应用长程工具使用(“工具十项全能”)。32 个真实应用、604 个 MCP 工具、108 道任务(平均 ~20 轮),初始环境是真实软件状态;评测脚本硬判分;全链路含轨迹开源
- DuMateBench — 真实办公交付 + failure 注入。200 道真实用户 session 重建任务(Text 160 · Code 88 · Web 86 …),Docker 环境注入缺工具/网络抖动/脏目录三类故障;5 harness × 4 模型对照,
F = 0.3P + 0.7J。国内唯一开放提交、直接给 agent 框架排名的榜;厂商自办,Judge 占 70% 权重
知识 / 推理
- Humanity’s Last Exam(HLE) — 人类知识前沿闭卷考。2500 道全球专家命制的研究生级+题目(多选/简答/含图像),命题原则是”出当前 AI 答不上的题”;带工具/闭卷口径差 20+ 分是读榜第一注意点
- Apex Shortlist(MathArena Apex) — 极限竞赛数学。从近百场 2025 竞赛中只筛”前沿模型 4 次尝试做不出”的题(初版 12 道);Shortlist 为 DeepSeek 引用口径的候选短名单(定义未公开,页面有考证)
竞赛 rating
- Codeforces rating — 算法竞赛能力。模型打真实 Codeforces 比赛,与人类共用 Elo 体系(1900 Candidate Master / 2400 Grandmaster / 3000+ Legendary GM),分数自带人类相对解释力;live contest 天然防污染。衍生集:LiveCodeBench/Pro、CodeforcesEval
中文向
- SuperCLUE — 中文大模型综合测评体系(CLUE 组织)。月度六维加权榜(智能体编程 25%/数学 18%/科学 16%/指令遵循 16%/幻觉控制 16%/任务规划 9%),题库每两个月 100% 原创替换防污染;另有 40+ 中文专项子基准(法律/金融/医疗/SWE/长文本……)
相关
- leaderboards — 所有榜单总览(各 LLM 能力强度)