触发问题

自研 Coding Agent harness,主要目的是对外宣传曝光,预算先试水——应该刷哪个榜?

结论

  • 试水阶段:SWE-bench-Live(Lite split)。自助 PR 提交、Lite/Verified split 已冻结便于公平对比、未饱和(Lite 榜首 63%)、按 model+agent 组合提交所以 harness 优势可见;须提交 rollout 轨迹,通过核验后挂 Verified 标签。成本量级 7k(300 题约 14.5 亿 token,按主流前沿模型单价推断)。
  • 正式对外主打:Terminal-Bench 4.0。唯一能证明「模型 + agent harness」整体能力的成熟公开榜,成本 9,604;但 4.0 社区提交当前已正式关闭,只有维护方跑的结果会进榜,目前只能自证、无法投稿。
  • 不要选:DeepSWE / SWE-rebench(统一 scaffold 会抹平 harness 优势);SWE-bench Verified(已饱和、OpenAI 停报、且只收学术提交)。

勘误(2026-09-19):本页初版把 SWE-bench-Live Lite 成本写成「$20–230」,那是原版 SWE-bench bash-only 极简 harness 的数字,不适用于真实 agent。实测单实例约 483 万 token(140 轮),300 题约 14.5 亿 token。同时初版称 Terminal-Bench「需通过 Discord 联系维护方」过于乐观,实际是社区提交通道已关闭。详见 swe-bench-live 与 terminal-bench。

2026-09-22 补充:另外两条可打路线

初版只覆盖了国际榜,遗漏了两个公司可自助提交的选项:

  • 补多语言维度 → Multi-SWE-bench(字节 Seed)。1,632 题 / 7 语言,按语言切榜,可以只打 Java 或 C++。单语言成本比整榜低一个量级(Java 128 题,按 130–$640)。当前 C 54.3% / Java 47.9% / C++ 47.3%,未饱和,且主力是工业团队(华为 CodeArts、InfCode、RepoRepair)而非学术机构。代价:无防污染设计(题集静态,全部 2025-04 前已 merge 的 PR)、分母漂移(同语言 total 出现 117/125/127/128),只能当补充证据,不能当主证据。
  • 证明 harness 工程能力 → DuMateBench(百度搭子)。国内唯一开放提交、直接给 agent 框架排名的榜,且与 Terminal-Bench 共用 Harbor,agent 适配投入可复用。榜上已有 OpenCode 69.1 / OpenClaw 78.0 的现成基线,适合「OpenCode 二开」正面对标。代价:它不是 coding 榜(Code 仅 88/200),厂商自办且自己第一,Judge 占 70% 权重,门槛为 200 题 × 5 trials(1000+ rollout,10k)。

修正后的选择矩阵

目标选它
代码修复能力的主证据(对外引用最硬)SWE-bench-Live
harness 工程能力(国内可投稿)DuMateBench
harness 工程能力(国外最权威但不可投稿)Terminal-Bench 4.0(自证)
多语言 / 企业级语言泛化Multi-SWE-bench(选 1–2 个语言)
国内政企 / 投标背书信通院方升-Code 2.0 / AI4SE 4+ 级(认证类,不是公开榜)

修正:本页上一版结论「国内没有自助式 Coding Agent 榜」需收窄——国内确实没有同形态的代码修复自助榜(SuperCLUE-SWE、方升、OpenCompass 都是认证或模型横评),但有 DuMateBench 这个开放提交的 harness 型 Agent 榜。

三段式路径

  1. 第 0 段(约 1 周,近零成本):按 Harbor Agent 接口适配跑通,小样本验证工具调用与超时行为。这份适配可同时用于 Terminal-Bench 与 DuMateBench。
  2. 第 1 段(约 1–2 周,7k):完整跑 SWE-bench-Live Lite,提 PR 拿 Verified 标签。
  3. 第 2 段:凭已有标签背书,再接触 Terminal-Bench 维护方——注意 4.0 对外通道当前关闭,需等待开放;同时可低成本补 Multi-SWE-bench 单语言、或投稿 DuMateBench。

关联页面