一句话定位:DeepSeek 内部使用的全栈开发测试集,随 V4-Flash 正式版(2026-07-31)发布材料进入公众视野——任务、样本量、评分器均未公开,属于”厂商私有基准”,读它的价值在于观察 DeepSeek 的后训练方向,而不是当外部排名依据。

基本情况

项说明
性质DeepSeek 内部测试集(非公开),官方注释原文:“DSBench-FullStack 是内部使用的全栈开发测试集”
首次出现2026-07-31 DeepSeek-V4-Flash 正式版 API 更新日志(api-docs.deepseek.com);2026-08-13 V4-Pro-0813 发布再次引用
测试协议(DeepSeek 自家模型)DeepSeek Harness 极简模式(agent 框架),reasoning effort = max,top_p=0.95,temperature=1.0
未公开内容任务数量、题目来源、验证器/评分器、运行轨迹——第三方无法复现或独立验证
姊妹测试集DSBench-Hard:内部困难 Coding Agent 测试集,常与 FullStack 同表发布

排行榜

已知分数见 dsbench-fullstack(均为 DeepSeek 发布材料口径:Opus 4.8 71.6 > V4-Flash 68.7;V4-Pro 正式版 71.1)。

怎么读这个分数

  1. 不是外部排名依据:第三方评论的共识——“未公开任务、样本量和评分器,适合内部回归,不适合外部排名”。不能复现的基准只能当参考信号
  2. 但也不是纯自夸:对比表里 Opus 4.8(71.6)压过了自家 V4-Flash(68.7),且 V4-Pro 承认落后 Fable 5 约 6 分——DeepSeek 用自家 harness 测竞品并如实发布落后结果,这在厂商私有基准里算坦诚
  3. 真正的价值是方向信号:为全栈开发单独立内部测试集(还配一个 Hard 版),说明 DeepSeek 后训练在重点堆”从零搭全栈应用”能力——这与 V4 系列主打 agent/工程能力的产品策略一致
  4. 同 harness 比较才有意义:所有分数都在 DeepSeek Harness 极简模式下跑,横向可比;拿它和其他 harness 下的 SWE-bench 分数对比没有意义

同名注意:学术界另有一个 DSBench

学术基准 DSBench(How Far Are Data Science Agents from Becoming Data Science Experts?,OpenReview/ICLR 系)与本页完全无关:那个是数据科学 agent 基准,含 466 个数据分析任务 + 74 个数据建模任务,来自真实企业与 Kaggle 竞赛,测长上下文/多模态数据科学工作流。看到”DSBench”先分清语境。

局限性

  • 完全不可复现:无题目、无验证器、无轨迹,外部既不能跑也不能审计
  • 样本量未知,分数方差/显著性无从评估
  • 厂商内部基准普遍存在”对着自家测试集训练”的过拟合风险(即使无主观故意)
  • 只出现在 DeepSeek 发布材料里,无独立第三方复测

资源

相关页面

  • dsbench-fullstack — 本测试集已知分数快照
  • vibe-code-bench — 从零建全栈应用基准(公开可复现的”外部对照”,测的能力维度最接近)
  • swe-bench-verified — 修真实仓库 bug 基准(DeepSeek 同表发布的公开基准之一)
  • terminal-bench — 终端环境任务基准(V4-Flash 同表 82.7)
  • toolathlon — Toolathlon:跨应用长程工具使用基准(V4-Flash 同表 70.3 的公开原版)
  • deepswe — DeepSWE:V4-Flash 同表 54.4 的公开原版(mini-swe-agent 口径 53%)
  • llm-vram-usage-calculation — DeepSeek-V4-Flash 284B/13B 显存计算页(同模型)