一句话定位:Datacurve 出品的”防饱和”长时域软件工程基准——113 道全新原创任务(非改编现有 commit/PR)、91 个真实仓库、5 种语言,所有模型统一跑 mini-swe-agent 排除 harness 变量,专治”前沿模型在现有公开榜上挤成一团分不出高低”的问题。

为什么值得关注

  • 四个设计主张(v1 博客):
    1. 零污染:任务从零编写,不是从现有 commit/PR 改编——预训练里不可能见过答案(还内置 canary GUID 监测训练语料泄露)
    2. 高多样性:91 仓库跨 5 语言(TypeScript/JavaScript/Go/Rust/Python),任务如 happy-dom 关机中止 body read、prometheus PromQL 标签排序、yjs Map 冲突检测、wasmi coredump 生成
    3. 真实复杂度:prompt 只有 SWE-bench Pro 的一半长,但参考解答代码量 5.5x、输出 token ~2x
    4. 可靠验证:verifier 人工编写,测软件行为而非实现细节
  • 统一 harness:全部模型用 mini-swe-agent 跑(同 swe-bench-verified 的 Bash-Only 思路),榜上差异 = 模型差异
  • 榜单网站本身做得好:Pass@1 vs 平均成本散点图(“most efficient”视角)、输出 token/agent 步数视图、56 个模型配置、全部 rollout 轨迹可浏览、可自跑 agent 提交
  • v1.1(2026-06-14)把判分改成隔离环境执行 committed diff(SWE-bench 式),agent 不能再 monkey-patch 测试框架/删测试钻空子——CTRF 报告会暴露缺测行为

排行榜

模型分数见 deepswe(v1.1 快照,榜首 Claude Opus 5 74%,含成本/输出 token/步数列——成本差达 360x)。

版本线:v1(2026-05 发布)→ v1.1(2026-06-14:隔离判分/CTRF 报告/自然 git 环境/修依赖漂移/删 flaky 测试);10 个双版本配置复测显示分数变化 ≤9 分、头部顺序不变。

局限性

  • 113 题规模小(stderr ±2-6%)
  • 任务全部原创意味着无历史可比基线(不像 SWE-bench 有两年纵向数据)
  • 统一 mini-swe-agent 排除了 harness 变量,也看不到”模型+最强 harness”的上限

资源

相关页面

  • deepswe — 本基准榜单快照
  • swe-bench-verified — 最近的同类基准(DeepSWE 的隔离判分即 SWE-bench 式;mini-swe-agent 两边通用)
  • dsbench-fullstack — DeepSeek 内部全栈测试集(其发布表中的 DeepSWE 数字可在此对照口径)
  • terminal-bench — 终端环境长程任务基准
  • vibe-code-bench — 从零建应用基准(同为对抗 coding 榜饱和的新一代设计)