一句话定位:Datacurve 出品的”防饱和”长时域软件工程基准——113 道全新原创任务(非改编现有 commit/PR)、91 个真实仓库、5 种语言,所有模型统一跑 mini-swe-agent 排除 harness 变量,专治”前沿模型在现有公开榜上挤成一团分不出高低”的问题。
为什么值得关注
- 四个设计主张(v1 博客):
- 零污染:任务从零编写,不是从现有 commit/PR 改编——预训练里不可能见过答案(还内置 canary GUID 监测训练语料泄露)
- 高多样性:91 仓库跨 5 语言(TypeScript/JavaScript/Go/Rust/Python),任务如 happy-dom 关机中止 body read、prometheus PromQL 标签排序、yjs Map 冲突检测、wasmi coredump 生成
- 真实复杂度:prompt 只有 SWE-bench Pro 的一半长,但参考解答代码量 5.5x、输出 token ~2x
- 可靠验证:verifier 人工编写,测软件行为而非实现细节
- 统一 harness:全部模型用 mini-swe-agent 跑(同 swe-bench-verified 的 Bash-Only 思路),榜上差异 = 模型差异
- 榜单网站本身做得好:Pass@1 vs 平均成本散点图(“most efficient”视角)、输出 token/agent 步数视图、56 个模型配置、全部 rollout 轨迹可浏览、可自跑 agent 提交
- v1.1(2026-06-14)把判分改成隔离环境执行 committed diff(SWE-bench 式),agent 不能再 monkey-patch 测试框架/删测试钻空子——CTRF 报告会暴露缺测行为
排行榜
模型分数见 deepswe(v1.1 快照,榜首 Claude Opus 5 74%,含成本/输出 token/步数列——成本差达 360x)。
版本线:v1(2026-05 发布)→ v1.1(2026-06-14:隔离判分/CTRF 报告/自然 git 环境/修依赖漂移/删 flaky 测试);10 个双版本配置复测显示分数变化 ≤9 分、头部顺序不变。
局限性
- 113 题规模小(stderr ±2-6%)
- 任务全部原创意味着无历史可比基线(不像 SWE-bench 有两年纵向数据)
- 统一 mini-swe-agent 排除了 harness 变量,也看不到”模型+最强 harness”的上限
资源
- 榜单网站:https://deepswe.datacurve.ai/(Leaderboard/Run/Data/GitHub 四入口,轨迹全公开)
- 博客:Introducing DeepSWE(2026-05)、DeepSWE v1.1(2026-06)
- 出品方:Datacurve(Wenqi Huang, Peter Jiang)
相关页面
- deepswe — 本基准榜单快照
- swe-bench-verified — 最近的同类基准(DeepSWE 的隔离判分即 SWE-bench 式;mini-swe-agent 两边通用)
- dsbench-fullstack — DeepSeek 内部全栈测试集(其发布表中的 DeepSWE 数字可在此对照口径)
- terminal-bench — 终端环境长程任务基准
- vibe-code-bench — 从零建应用基准(同为对抗 coding 榜饱和的新一代设计)