触发问题
自研 Coding Agent harness,主要目的是对外宣传曝光,预算先试水——应该刷哪个榜?
结论
- 试水阶段:SWE-bench-Live(Lite split)。自助 PR 提交、Lite/Verified split 已冻结便于公平对比、未饱和(Lite 榜首 63%)、按 model+agent 组合提交所以 harness 优势可见;须提交 rollout 轨迹,通过核验后挂 Verified 标签。成本量级 7k(300 题约 14.5 亿 token,按主流前沿模型单价推断)。
- 正式对外主打:Terminal-Bench 4.0。唯一能证明「模型 + agent harness」整体能力的成熟公开榜,成本 9,604;但 4.0 社区提交当前已正式关闭,只有维护方跑的结果会进榜,目前只能自证、无法投稿。
- 不要选:DeepSWE / SWE-rebench(统一 scaffold 会抹平 harness 优势);SWE-bench Verified(已饱和、OpenAI 停报、且只收学术提交)。
勘误(2026-09-19):本页初版把 SWE-bench-Live Lite 成本写成「$20–230」,那是原版 SWE-bench bash-only 极简 harness 的数字,不适用于真实 agent。实测单实例约 483 万 token(140 轮),300 题约 14.5 亿 token。同时初版称 Terminal-Bench「需通过 Discord 联系维护方」过于乐观,实际是社区提交通道已关闭。详见 swe-bench-live 与 terminal-bench。
2026-09-22 补充:另外两条可打路线
初版只覆盖了国际榜,遗漏了两个公司可自助提交的选项:
- 补多语言维度 → Multi-SWE-bench(字节 Seed)。1,632 题 / 7 语言,按语言切榜,可以只打 Java 或 C++。单语言成本比整榜低一个量级(Java 128 题,按 130–$640)。当前 C 54.3% / Java 47.9% / C++ 47.3%,未饱和,且主力是工业团队(华为 CodeArts、InfCode、RepoRepair)而非学术机构。代价:无防污染设计(题集静态,全部 2025-04 前已 merge 的 PR)、分母漂移(同语言 total 出现 117/125/127/128),只能当补充证据,不能当主证据。
- 证明 harness 工程能力 → DuMateBench(百度搭子)。国内唯一开放提交、直接给 agent 框架排名的榜,且与 Terminal-Bench 共用 Harbor,agent 适配投入可复用。榜上已有 OpenCode 69.1 / OpenClaw 78.0 的现成基线,适合「OpenCode 二开」正面对标。代价:它不是 coding 榜(Code 仅 88/200),厂商自办且自己第一,Judge 占 70% 权重,门槛为 200 题 × 5 trials(1000+ rollout,10k)。
修正后的选择矩阵
| 目标 | 选它 |
|---|---|
| 代码修复能力的主证据(对外引用最硬) | SWE-bench-Live |
| harness 工程能力(国内可投稿) | DuMateBench |
| harness 工程能力(国外最权威但不可投稿) | Terminal-Bench 4.0(自证) |
| 多语言 / 企业级语言泛化 | Multi-SWE-bench(选 1–2 个语言) |
| 国内政企 / 投标背书 | 信通院方升-Code 2.0 / AI4SE 4+ 级(认证类,不是公开榜) |
修正:本页上一版结论「国内没有自助式 Coding Agent 榜」需收窄——国内确实没有同形态的代码修复自助榜(SuperCLUE-SWE、方升、OpenCompass 都是认证或模型横评),但有 DuMateBench 这个开放提交的 harness 型 Agent 榜。
三段式路径
- 第 0 段(约 1 周,近零成本):按 Harbor Agent 接口适配跑通,小样本验证工具调用与超时行为。这份适配可同时用于 Terminal-Bench 与 DuMateBench。
- 第 1 段(约 1–2 周,7k):完整跑 SWE-bench-Live Lite,提 PR 拿 Verified 标签。
- 第 2 段:凭已有标签背书,再接触 Terminal-Bench 维护方——注意 4.0 对外通道当前关闭,需等待开放;同时可低成本补 Multi-SWE-bench 单语言、或投稿 DuMateBench。
关联页面
- README — 打榜指南目录(一榜一页)
- swe-bench-live — SWE-bench-Live 打榜全流程
- multi-swe-bench — Multi-SWE-bench 打榜全流程
- dumatebench — DuMateBench 打榜全流程
- terminal-bench — Terminal-Bench 打榜全流程
- coding-agent-leaderboards — 榜单横向地图 + 打榜可提交性对照表
- multi-swe-bench — Multi-SWE-bench 评测集定义
- dumatebench — DuMateBench 评测集定义
- terminal-bench — Terminal-Bench 4.0 评测集定义
- terminal-bench — TB 4.0 分数快照与成本列
- harbor — 官方执行框架,适配 agent 的入口
- deepswe — 统一 scaffold 榜,harness 型团队不宜作为主战场