评测集定义与方法论见 multi-swe-bench。本页只放分数。
口径警示:榜上同时存在①论文自跑的官方移植 scaffold、②社区自提交的自研 agent,且各提交的分母不完全一致(见下)。跨条目比较只能看数量级,不能当严格同口径排名。
论文基线(2025-04,9 模型 × 3 scaffold)
| 语言 | 最佳 resolved rate | 最佳组合 |
|---|---|---|
| Python(对照) | 52.20% | MopenHands + Claude-3.7-Sonnet |
| Java | 23.44% | MSWE-agent + Claude-3.7-Sonnet |
| TypeScript | 11.61% | MopenHands + Claude-3.5-Sonnet |
| JavaScript | 5.06% | MopenHands + Claude-3.7-Sonnet |
| Go | 7.48% | MopenHands + Claude-3.7-Sonnet |
| Rust | 15.90% | MopenHands + Claude-3.7-Sonnet |
| C | 8.59% | MSWE-agent / MopenHands + Claude-3.7-Sonnet |
| C++ | 14.73% | MopenHands + Claude-3.7-Sonnet |
9 个模型 = GPT-4o / o1 / o3-mini-high / Claude-3.5-Sonnet / Claude-3.7-Sonnet / DeepSeek-V3 / DeepSeek-R1 / Qwen2.5-72B-Instruct / Doubao-1.5-pro。三 scaffold 中 MopenHands + Claude-3.7-Sonnet 综合最优(macro 16.01 / instance-weighted 19.33),最差为 Qwen2.5-72B-Instruct 组合(1.74–2.02)。
社区提交快照(实测 experiments 仓库 results.json,截至 2026-09-22)
按语言取当前最新/最高提交:
| 语言 | 提交 | resolved / total | 率 | 日期 |
|---|---|---|---|---|
| C | CodeArts-Agent + CodeArts-GLM-5.1 | 69 / 127 | 54.3% | 2026-06-24 |
| Java | CodeArts-Agent + CodeArts-MiniMax-M2.5 | 56 / 117 | 47.9% | 2026-03-27 |
| C++ | CodeArts-Agent + CodeArts-GLM-5.1 | 61 / 129 | 47.3% | 2026-07-14 |
| Java | InfCode + GPT-5.2 | 50 / 128 | 39.1% | 2026-01-31 |
| Java | iSWE Agent | 43 / 127 | 33.9% | 2025-12-01 |
| Java | MSWE-Agent + CodeArts-MiniMax-M2.5 | 35 / 125 | 28.0% | 2026-03-27 |
| TypeScript | RepoRepair + Claude-3.5-Sonnet | 61 / 224 | 27.2% | 2025-09-10 |
| C++ | InfCode + GPT-5 | 33 / 129 | 25.6% | 2025-11-10 |
| JavaScript | RepoRepair + Claude-4.5-Sonnet | 61 / 334 | 18.3% | 2026-02-02 |
| C | RepoRepair + Claude-4-Sonnet | 14 / 111 | 12.6% | 2025-12-26 |
分母漂移实测:同为 Java 全量,提交分母出现 117 / 125 / 127 / 128 四种;TypeScript 有 224 全量与 148 部分提交;JavaScript 有 334 与 356 两种。引用百分比时必须同时写出 resolved/total。
分数观察
- 一年涨 3–6 倍:Java/C/C++ 从论文时代的 8–23% 涨到当前的 47–54%,说明企业级语言仍有明确提升空间,也说明这些语言的榜位还没挤满
- Python 与 TypeScript 已停滞:Python 榜自 2025-04 后无新提交,TypeScript 最新为 2025-09——这两个语言不是当前主战场
- Agent 名即答案:当前高分条目全部来自带自有 harness 的团队(华为 CodeArts、InfCode、RepoRepair),说明该榜确实能体现 harness 工程能力,而非只测基座模型
- Verified 标记稀缺:绝大多数条目
verified: false,即未经维护方在随机子集上复跑确认 - 榜位偏工业界:与 SWE-bench 官方榜「仅收学术」相反,这里的主力是厂商团队——但厂商自报 + 缺 Verified,引用时需与 SWE-bench-Live 的强制轨迹复核区别对待
相关
- multi-swe-bench — 评测集定义与方法论
- multi-swe-bench — 打榜实操与成本
- coding-agent-leaderboards — 榜单横向地图
- swe-bench-verified — Python 单语对照
- deepswe — 统一 scaffold 榜对照