评测集定义与方法论见 multi-swe-bench。本页只放分数。

口径警示:榜上同时存在①论文自跑的官方移植 scaffold、②社区自提交的自研 agent,且各提交的分母不完全一致(见下)。跨条目比较只能看数量级,不能当严格同口径排名。

论文基线(2025-04,9 模型 × 3 scaffold)

语言最佳 resolved rate最佳组合
Python(对照)52.20%MopenHands + Claude-3.7-Sonnet
Java23.44%MSWE-agent + Claude-3.7-Sonnet
TypeScript11.61%MopenHands + Claude-3.5-Sonnet
JavaScript5.06%MopenHands + Claude-3.7-Sonnet
Go7.48%MopenHands + Claude-3.7-Sonnet
Rust15.90%MopenHands + Claude-3.7-Sonnet
C8.59%MSWE-agent / MopenHands + Claude-3.7-Sonnet
C++14.73%MopenHands + Claude-3.7-Sonnet

9 个模型 = GPT-4o / o1 / o3-mini-high / Claude-3.5-Sonnet / Claude-3.7-Sonnet / DeepSeek-V3 / DeepSeek-R1 / Qwen2.5-72B-Instruct / Doubao-1.5-pro。三 scaffold 中 MopenHands + Claude-3.7-Sonnet 综合最优(macro 16.01 / instance-weighted 19.33),最差为 Qwen2.5-72B-Instruct 组合(1.74–2.02)。

社区提交快照(实测 experiments 仓库 results.json,截至 2026-09-22)

按语言取当前最新/最高提交:

语言提交resolved / total率日期
CCodeArts-Agent + CodeArts-GLM-5.169 / 12754.3%2026-06-24
JavaCodeArts-Agent + CodeArts-MiniMax-M2.556 / 11747.9%2026-03-27
C++CodeArts-Agent + CodeArts-GLM-5.161 / 12947.3%2026-07-14
JavaInfCode + GPT-5.250 / 12839.1%2026-01-31
JavaiSWE Agent43 / 12733.9%2025-12-01
JavaMSWE-Agent + CodeArts-MiniMax-M2.535 / 12528.0%2026-03-27
TypeScriptRepoRepair + Claude-3.5-Sonnet61 / 22427.2%2025-09-10
C++InfCode + GPT-533 / 12925.6%2025-11-10
JavaScriptRepoRepair + Claude-4.5-Sonnet61 / 33418.3%2026-02-02
CRepoRepair + Claude-4-Sonnet14 / 11112.6%2025-12-26

分母漂移实测:同为 Java 全量,提交分母出现 117 / 125 / 127 / 128 四种;TypeScript 有 224 全量与 148 部分提交;JavaScript 有 334 与 356 两种。引用百分比时必须同时写出 resolved/total。

分数观察

  1. 一年涨 3–6 倍:Java/C/C++ 从论文时代的 8–23% 涨到当前的 47–54%,说明企业级语言仍有明确提升空间,也说明这些语言的榜位还没挤满
  2. Python 与 TypeScript 已停滞:Python 榜自 2025-04 后无新提交,TypeScript 最新为 2025-09——这两个语言不是当前主战场
  3. Agent 名即答案:当前高分条目全部来自带自有 harness 的团队(华为 CodeArts、InfCode、RepoRepair),说明该榜确实能体现 harness 工程能力,而非只测基座模型
  4. Verified 标记稀缺:绝大多数条目 verified: false,即未经维护方在随机子集上复跑确认
  5. 榜位偏工业界:与 SWE-bench 官方榜「仅收学术」相反,这里的主力是厂商团队——但厂商自报 + 缺 Verified,引用时需与 SWE-bench-Live 的强制轨迹复核区别对待

相关