本目录存放打榜相关的实操信息:某个榜怎么跑、怎么提交、要交什么材料、花多少钱、哪些坑不能踩。
一榜一页,新榜出现时在本目录新增独立页面,不要往已有页面里塞。
收录标准
只有满足以下条件的榜单才在本目录建页:
- 有明确的提交路径(自助提交或已知的收录渠道)
- 有可核验的评测协议(能查到数据集、判分方式、harness 约束)
- 有实际打榜价值(对外可引用,或能作为内部技术验证基线)
只用来「读分数」的榜单不进本目录,见 leaderboards。
榜单清单
| 榜单 | 页面 | 能否自助提交 | 成本量级 | 状态 |
|---|---|---|---|---|
| SWE-bench-Live | swe-bench-live | 能(PR 提交) | 7k | 开放,推荐首选(抗污染 + 轨迹核验) |
| Multi-SWE-bench | multi-swe-bench | 能(PR 到 experiments,可按语言) | 单语言 600 / 全量 8k | 开放;无防污染,作补充证据 |
| DuMateBench | dumatebench | 能(Harbor --upload --public + manifest PR) | 10k(1000+ rollout) | 开放;国内唯一 harness 型自助榜 |
| Terminal-Bench 4.0 | terminal-bench | 不能(社区提交已关闭) | 9,604 | 只能自证,等通道开放 |
打榜配套仓库(opensources/)
不是榜单,是打榜链路上游/中游的现成实现,统一放在本目录的 opensources/ 子目录下,与一榜一页的榜单页分开。按在链路里的位置分三类:
① 基准工具链(榜单背后的项目本体)
| 项目 | 说明 |
|---|---|
| swe-bench-live | microsoft/SWE-bench-Live 本体:造题流水线(爬仓库→筛仓库→抓 issue-PR→LLM 判质→建环境→验证)+ 评估器;本地自测 patch 用的就是它 |
② 环境 / 任务生成(跑 agent 之前)
| 项目 | 说明 |
|---|---|
| repolaunch | RepoLaunch:给 repo + commit 自动造 Docker 环境、重建/测试命令与用例级 parser;SBL 的题目环境即由它生成 |
③ harness 接入(怎么把 agent 接上榜单)
| Harness | 说明 |
|---|---|
| swe-agent-for-eval | SWE-agent 的评测 fork;本地 JSONL 数据源 + 合规禁 git prompt + 内联 SWE-ReX |
同作者另有 OpenHands / ClaudeCode 两条线(njukenanli/OpenHands-for-eval、njukenanli/ClaudeCode-for-eval),思路一致,见 swe-agent-for-eval 页内说明。
相邻目录分工
| 目录 | 存什么 |
|---|---|
| 本目录 | 打榜实操:怎么跑、怎么提交、成本、坑 |
submission/opensources/ | 打榜配套仓库:基准工具链 + 环境/任务生成 + harness 接入 |
llms/benchmarks/ | 评测集本身是什么:任务形态、判分方法论 |
llms/leaderboards/ | 分数快照:谁排第几、当前榜首 |
| coding-agent-leaderboards | 榜单横向地图与可信度分层 |
| coding-agent-leaderboard-selection | 选型决策:该打哪个榜 |
新增榜单页模板
在本目录新建 <榜单名>.md,按以下骨架填写:
---
title: <榜单名> 打榜指南
created: YYYY-MM-DD
updated: YYYY-MM-DD
type: query
tags: [ai-ml, benchmark, ecosystem]
sources:
- <官方页>
mastery_target: familiar
mastery_current: aware
---
# <榜单名> 打榜指南
## 是什么
(定位 / 维护方 / 任务形态 / 规模 / 指标 / 版本口径)
## 怎么打
(环境安装 → 跑评测 → 接入自研 agent → 提交步骤 → 必填材料 → 核验机制)
## 成本
(分档给出题量、耗时、美元区间,标明官方口径还是推断)
## 常见坑
(编号列出,每条可操作)
## 相关
(至少 2 个 wikilink)
## 信源建页后必须同步:index.md 条目与计数、log.md 记录、以及本页的「榜单清单」表。
相关
- coding-agent-leaderboards — 榜单总览与可信度分层
- coding-agent-leaderboard-selection — 打榜选型结论
- harbor — Terminal-Bench 官方执行框架