评测集定义与方法论见 dumatebench。本页只放分数。

读榜要点:官网榜单默认是「View by harness」+ 基座模型 GPT-5.5 的切片,不是全模型平均。跨 harness 比较前先确认当前的 base model 筛选器,切换模型后名次会变(例如 OpenClaw 在 Opus-4.8 下只有 0.5821)。

官网榜(默认视图:base model = GPT-5.5,200 题)

#HarnessPartial PJudge JFinal F
1DuMate90.3%77.7%81.5%
2Hermes90.0%76.3%80.4%
3Claude Code86.1%74.9%78.3%
4OpenClaw82.8%75.9%78.0%
5OpenCode77.0%65.7%69.1%

F = 0.3P + 0.7J,三个指标分别对 200 题取宏平均。

完整 20 组配置(论文 Table 2,Final score F)

HarnessGPT-5.5Opus-4.8GLM-5.2DeepSeek-V4-Proharness 均值
DuMate0.81450.85480.80460.83500.8272
Hermes0.80440.81810.75250.82230.7993
Claude Code0.78300.81390.66740.80520.7674
OpenCode0.69060.79820.77610.80170.7667
OpenClaw0.77970.58210.72530.78870.7190
模型均值0.77440.77340.74520.8106—

加粗为列内最优。DuMate 在 4 个基座模型下全部第一(见风险提示)。最低的单格是 OpenClaw + Opus-4.8 的 0.5821。

效率(论文 Table 3,每题均值)

Harness模型耗时(s)Input tokenOutput tokenTotal tokenF
Claude CodeGPT-5.5275281,5397,625289,1640.7830
Claude CodeOpus-4.8464336,54914,744351,2930.8139
Claude CodeGLM-5.29444,579,66224,2684,603,9300.6674
Claude CodeDS-V4-Pro7853,043,96624,5273,068,4930.8052
HermesGPT-5.5376356,9069,608366,5140.8044
HermesOpus-4.8517757,35914,032771,3910.8181
HermesGLM-5.28101,059,62520,4441,080,0690.7525
HermesDS-V4-Pro8481,151,06329,4071,180,4700.8223
DuMateGPT-5.5518868,0238,636876,6590.8145
DuMateOpus-4.810391,548,84413,2801,562,1240.8548
DuMateGLM-5.26952,231,59223,3392,254,9310.8046
DuMateDS-V4-Pro8221,730,00736,2191,766,2260.8350
OpenCodeGPT-5.5369269,2804,252273,5320.6906
OpenCodeOpus-4.8604762,89413,216776,1100.7982
OpenCodeGLM-5.24481,191,09713,0491,204,1460.7761
OpenCodeDS-V4-Pro5131,029,0079,0791,038,0860.8017
OpenClawGPT-5.5293485,9558,239494,1940.7797
OpenClawOpus-4.8300809,4407,988817,4280.5821
OpenClawGLM-5.2390908,67312,847921,5200.7253
OpenClawDS-V4-Pro4831,215,11120,0511,235,1620.7887

input token 含 cache-read token。

分数观察

  1. harness 差异可达 27 分:同一个 Opus-4.8,在 DuMate 下 0.8548、在 OpenClaw 下 0.5821。反过来 DeepSeek-V4-Pro 的跨 harness 极差只有 4.63 分(0.7887–0.8350)。harness 与模型的匹配度,比单独看任何一方都重要——这是本榜对 harness 型团队最有价值的一条
  2. 质量与成本强烈背离:最省 token 的 OpenCode + GPT-5.5(274k/题)分数最低(0.6906);最高分的 DuMate + Opus-4.8 最慢(1039s)且耗 1.56M token。同分档位的成本可差 5–17 倍
  3. GLM-5.2 是长上下文成本陷阱:Claude Code + GLM-5.2 每题吃 4.6M input token(榜首组合的 16 倍),分数却是全表最低档(0.6674)
  4. 国产模型不弱:DeepSeek-V4-Pro 的模型均值(0.8106)高于 GPT-5.5(0.7744)与 Opus-4.8(0.7734),是唯一均值第一的非美系模型
  5. 尚无外部提交:leaderboard/published.json 为空数组,当前 5 条均为论文自跑。第一批第三方提交的位置是公开的

风险提示

  • 厂商自评第一:DuMate 在 4 个基座模型下全部第一,且该榜由百度搭子发布——引用时须说明利益相关
  • Judge 权重 70%:最终分主要由 LLM Judge 决定,不是确定性测试;与 SWE-bench 的测试判定不属同一可信度类别
  • 口径矛盾待确认:论文/官网 0.3P + 0.7J vs 仓库 submissions/README.md 的「30% complete + 30% partial + 40% judge」
  • 版本未定:官网多处标注 Version TBD,跨时间引用需记录抓取日期

相关