评测集定义与方法论见 dumatebench。本页只放分数。
读榜要点:官网榜单默认是「View by harness」+ 基座模型 GPT-5.5 的切片,不是全模型平均。跨 harness 比较前先确认当前的 base model 筛选器,切换模型后名次会变(例如 OpenClaw 在 Opus-4.8 下只有 0.5821)。
官网榜(默认视图:base model = GPT-5.5,200 题)
| # | Harness | Partial P | Judge J | Final F |
|---|---|---|---|---|
| 1 | DuMate | 90.3% | 77.7% | 81.5% |
| 2 | Hermes | 90.0% | 76.3% | 80.4% |
| 3 | Claude Code | 86.1% | 74.9% | 78.3% |
| 4 | OpenClaw | 82.8% | 75.9% | 78.0% |
| 5 | OpenCode | 77.0% | 65.7% | 69.1% |
F = 0.3P + 0.7J,三个指标分别对 200 题取宏平均。
完整 20 组配置(论文 Table 2,Final score F)
| Harness | GPT-5.5 | Opus-4.8 | GLM-5.2 | DeepSeek-V4-Pro | harness 均值 |
|---|---|---|---|---|---|
| DuMate | 0.8145 | 0.8548 | 0.8046 | 0.8350 | 0.8272 |
| Hermes | 0.8044 | 0.8181 | 0.7525 | 0.8223 | 0.7993 |
| Claude Code | 0.7830 | 0.8139 | 0.6674 | 0.8052 | 0.7674 |
| OpenCode | 0.6906 | 0.7982 | 0.7761 | 0.8017 | 0.7667 |
| OpenClaw | 0.7797 | 0.5821 | 0.7253 | 0.7887 | 0.7190 |
| 模型均值 | 0.7744 | 0.7734 | 0.7452 | 0.8106 | — |
加粗为列内最优。DuMate 在 4 个基座模型下全部第一(见风险提示)。最低的单格是 OpenClaw + Opus-4.8 的 0.5821。
效率(论文 Table 3,每题均值)
| Harness | 模型 | 耗时(s) | Input token | Output token | Total token | F |
|---|---|---|---|---|---|---|
| Claude Code | GPT-5.5 | 275 | 281,539 | 7,625 | 289,164 | 0.7830 |
| Claude Code | Opus-4.8 | 464 | 336,549 | 14,744 | 351,293 | 0.8139 |
| Claude Code | GLM-5.2 | 944 | 4,579,662 | 24,268 | 4,603,930 | 0.6674 |
| Claude Code | DS-V4-Pro | 785 | 3,043,966 | 24,527 | 3,068,493 | 0.8052 |
| Hermes | GPT-5.5 | 376 | 356,906 | 9,608 | 366,514 | 0.8044 |
| Hermes | Opus-4.8 | 517 | 757,359 | 14,032 | 771,391 | 0.8181 |
| Hermes | GLM-5.2 | 810 | 1,059,625 | 20,444 | 1,080,069 | 0.7525 |
| Hermes | DS-V4-Pro | 848 | 1,151,063 | 29,407 | 1,180,470 | 0.8223 |
| DuMate | GPT-5.5 | 518 | 868,023 | 8,636 | 876,659 | 0.8145 |
| DuMate | Opus-4.8 | 1039 | 1,548,844 | 13,280 | 1,562,124 | 0.8548 |
| DuMate | GLM-5.2 | 695 | 2,231,592 | 23,339 | 2,254,931 | 0.8046 |
| DuMate | DS-V4-Pro | 822 | 1,730,007 | 36,219 | 1,766,226 | 0.8350 |
| OpenCode | GPT-5.5 | 369 | 269,280 | 4,252 | 273,532 | 0.6906 |
| OpenCode | Opus-4.8 | 604 | 762,894 | 13,216 | 776,110 | 0.7982 |
| OpenCode | GLM-5.2 | 448 | 1,191,097 | 13,049 | 1,204,146 | 0.7761 |
| OpenCode | DS-V4-Pro | 513 | 1,029,007 | 9,079 | 1,038,086 | 0.8017 |
| OpenClaw | GPT-5.5 | 293 | 485,955 | 8,239 | 494,194 | 0.7797 |
| OpenClaw | Opus-4.8 | 300 | 809,440 | 7,988 | 817,428 | 0.5821 |
| OpenClaw | GLM-5.2 | 390 | 908,673 | 12,847 | 921,520 | 0.7253 |
| OpenClaw | DS-V4-Pro | 483 | 1,215,111 | 20,051 | 1,235,162 | 0.7887 |
input token 含 cache-read token。
分数观察
- harness 差异可达 27 分:同一个 Opus-4.8,在 DuMate 下 0.8548、在 OpenClaw 下 0.5821。反过来 DeepSeek-V4-Pro 的跨 harness 极差只有 4.63 分(0.7887–0.8350)。harness 与模型的匹配度,比单独看任何一方都重要——这是本榜对 harness 型团队最有价值的一条
- 质量与成本强烈背离:最省 token 的 OpenCode + GPT-5.5(274k/题)分数最低(0.6906);最高分的 DuMate + Opus-4.8 最慢(1039s)且耗 1.56M token。同分档位的成本可差 5–17 倍
- GLM-5.2 是长上下文成本陷阱:Claude Code + GLM-5.2 每题吃 4.6M input token(榜首组合的 16 倍),分数却是全表最低档(0.6674)
- 国产模型不弱:DeepSeek-V4-Pro 的模型均值(0.8106)高于 GPT-5.5(0.7744)与 Opus-4.8(0.7734),是唯一均值第一的非美系模型
- 尚无外部提交:
leaderboard/published.json为空数组,当前 5 条均为论文自跑。第一批第三方提交的位置是公开的
风险提示
- 厂商自评第一:DuMate 在 4 个基座模型下全部第一,且该榜由百度搭子发布——引用时须说明利益相关
- Judge 权重 70%:最终分主要由 LLM Judge 决定,不是确定性测试;与 SWE-bench 的测试判定不属同一可信度类别
- 口径矛盾待确认:论文/官网
0.3P + 0.7Jvs 仓库submissions/README.md的「30% complete + 30% partial + 40% judge」 - 版本未定:官网多处标注
Version TBD,跨时间引用需记录抓取日期
相关
- dumatebench — 评测集定义、协议与局限性
- dumatebench — 打榜实操(Harbor 提交链路、1000 rollout 门槛、成本)
- coding-agent-leaderboards — 榜单横向地图(本榜属 harness 型,不属 coding 类)
- terminal-bench — 共用 Harbor 的同类榜快照
- toolathlon — 跨应用工具使用榜对照