评测集定义与方法论见 swe-bench-verified。本页只放分数:各模型修真实仓库 issue 的能力强度。

Verified 总榜(各家用自己的 harness,前 12,共 180 条,抓取于 2026-08-13)

#模型Agent/Harness% Resolved日期
1Claude 4.5 Opuslive-SWE-agent79.2%2025-12
2Claude 4.5 OpusSonar Foundation Agent79.2%2025-12
3Doubao-Seed-CodeTRAE78.8%2025-09
4Gemini 3 Pro Previewlive-SWE-agent77.4%2025-11
5Multiple (Anthropic)Atlassian Rovo Dev76.8%2025-09
6Claude 4 SonnetEPAM AI/Run Developer Agent76.8%2025-08
7Claude 4.5 Opusmini-SWE-agent76.8%2026-02
8Multiple (Anthropic)ACoder76.4%2025-08
9Gemini 3 Flash / MiniMax M2.5mini-SWE-agent75.8%2026-02
10Multiple (OpenAI)Warp75.6%2025-09
11Claude 4.6 Opusmini-SWE-agent75.6%2026-02
12Claude 4.5 SonnetSonar Foundation Agent74.8%2025-11

Bash-Only 视图(官方默认视图:统一 mini-SWE-agent,前 12,共 47 条)

#模型% Resolved$/实例日期
1Claude 4.5 Opus76.8%$0.7542026-02
2Gemini 3 Flash75.8%$0.3562026-02
3MiniMax M2.5(开源权重)75.8%$0.0732026-02
4Claude 4.6 Opus75.6%$0.5522026-02
5Claude 4.5 Opus74.4%$0.7212025-11
6Gemini 3 Pro Preview74.2%$0.4602025-11
7GPT 5.2 Codex72.8%$0.4492026-02
8GLM 5(开源权重)72.8%$0.5342026-02
9GPT 5.272.8%$0.4742026-02
10Claude 4.5 Sonnet71.4%$0.6582026-02
11Kimi K2.5(开源权重)70.8%$0.1472026-02
12DeepSeek V3.2(开源权重)70.0%$0.4482026-02

分数观察

  1. harness 差异巨大:同一模型(Claude 4.5 Opus)总榜 79.2%(live-SWE-agent)vs bash-only 76.8%——总榜混入了 harness 工程能力,这是官方把 Bash-Only 设为默认视图的原因
  2. 成本差 10x:同为 75.8%,MiniMax M2.5 每实例 0.754;开源权重(MiniMax/GLM/Kimi/DeepSeek)已占 bash-only 榜 1/3 且逼近闭源头部
  3. 进展速度:2024-08 发布时 GPT-4o + RAG scaffolding 约 33%,不到两年到 79%,但距人类专家基线 ~92% 仍有差距
  4. 污染风险:数据集公开且被当标准用了两年,榜单分数与真实泛化能力的差距是社区持续质疑点