评测集定义与方法论见 deepswe。本页只放分数:各模型长时域软件工程能力强度。
榜单(v1.1,当日更新 2026-08-13,每模型取最佳 effort,统一 mini-swe-agent)
| # | 模型 [effort] | Pass@1 | 成本/任务 | 输出 token | 步数 |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 [max] | 74% ±4 | $11.84 | 118k | 99 |
| 2 | GPT-5.6 Sol [max] | 73% ±3 | $8.39 | 60k | 61 |
| 3 | Claude Fable 5 [max] | 70% ±4 | $21.63 | 119k | 88 |
| 4 | GPT-5.6 Terra [max] | 70% ±3 | $3.96 | 72k | 76 |
| 5 | Kimi K3 [max] | 69% ±5 | $4.65 | 81k | 98 |
| 6 | GPT-5.6 Luna [max] | 67% ±4 | $0.61 | 73k | 102 |
| 7 | GPT-5.5 [xhigh] | 67% ±6 | $7.23 | 46k | 82 |
| 8 | Grok 4.6 [xhigh] | 67% ±2 | $5.50 | 71k | 87 |
| 9 | DeepSeek V4 Pro [max] | 63% ±6 | $0.06 | 106k | 155 |
| 10 | Claude Opus 4.8 [max] | 59% ±2 | $13.22 | 135k | 120 |
| 11-15 | Qwen3.8-Max 57% · Muse Spark 1.2 55% · Sonnet 5 54% · Grok 4.5 54% · DeepSeek V4 Flash 53%($0.10) | ||||
| 16-23 | Muse Spark 1.1 53% · GPT-5.4 52% · Gemini 3.6 Flash 49% · GLM-5.2 44% · Gemini 3.5 Flash 37% · Kimi K2.7 Code 31% · Sonnet 4.6 30% · Gemini 3.1 Pro 12% |
分数观察
- 成本差 360x:榜首档 Opus 5 0.06/任务(后者 155 步最长轨迹换极低成本);GPT-5.6 Luna 以 $0.61 拿 67% 是效率甜点
- 效率与质量不同榜:成本视图下 GPT-5.6 Luna/Gemini 3.1 Pro/Sonnet 4.6/Kimi K2.7 Code 落在”最便宜但低分”区——官网散点图才是这个榜的正确读法
- Claude Sonnet 5 的 268 步 $26.40:分数中上但最贵最磨叽,agent 风格差异巨大
- Gemini 3.1 Pro 仅 12% 明显异常(其余 Gemini 系 37-49%),跨基准排名不迁移又一例
- 脚注:Fable 5 有 73/2260 trials 因”美国政府指令中止访问”未完成(按已完成 trials 计)——评测史少见的外部干预记录
- 口径对照:DeepSeek 自家材料里 V4-Flash DeepSWE 54.4(自家 harness)vs 本榜 53%(mini-swe-agent),基本一致
- v1→v1.1:10 个双版本配置复测显示分数变化 ≤9 分、头部顺序不变