一句话定位:百度搭子(DuMate)出品的「真实办公交付」Agent 基准——200 道从真实用户 session 脱敏重建的多工具工作流任务,跑在注入了故障与噪声的 Docker 环境里,最终按「产物是否真的交付出来」评分,而不是按回答对不对评分。

分数快照见 dumatebench,打榜实操见 dumatebench。

它不是 Coding Agent 榜。200 题里只有 88 道涉及代码,且多为「办公 + 编码」混合工作流。在 coding-agent-leaderboards 的分类里,它与 Terminal-Bench 同属「harness 工程证明」,不属「代码修复能力」类。

为什么值得关注

  • 国内唯一开放可打的 harness 榜:采用通用评测框架 + 开放接入接口,任意 Harbor 兼容 agent 都能提交;公司/厂商友好,无 SWE-bench 官方榜那样的学术身份限制
  • 直接给 harness 排名:榜上的对手包括 OpenClaw、OpenCode、Claude Code、Hermes——与「OpenCode 二开」的定位正面相关,且有现成基线可对标
  • failure 注入是设计核心:Insufficient(缺工具/依赖)、Unstable(网络/API/OCR 抖动)、Noisy(干扰/过期/冲突文件)三类环境。多数基准假设干净环境,这里专测脏环境下的恢复能力
  • 产物级评测:判分对象是最终 workspace 里的 DOCX/Excel/PPTX/PDF/图片等交付物,能覆盖「多解任务」的语义质量;200 题全部来自真实用户 session 重建
  • 可与 Terminal-Bench 复用投入:两者都用 Harbor 执行,agent 适配工作可以共享

评测集构成

项说明
题量200 道可执行任务,从匿名化、隐私筛查后的真实多轮 session 重建
场景8 大类场景 / 17 个细粒度任务类型;任务构成图按 6 大领域划分
环境隔离 Docker 容器,三种条件:Insufficient / Unstable / Noisy
评测对象5 个 agent harness × 4 个基座模型 = 20 组配置
能力覆盖Text 160 · Code 88 · Web 86 · Files 34 · Multimedia 46 · DOCX 读取 27 · Excel 编辑 18(一题可跨多能力)
任务包结构instruction.md / task.yaml / task_type_feature.json / workspace_seed/ / evaluator/ / web_reference/

参与评测的 harness:DuMate v1.0.59、Hermes v0.19.0、Claude Code v2.1.212、OpenClaw v2026.7.1-2、OpenCode v1.18.4。 基座模型:GPT-5.5、Claude Opus-4.8、GLM-5.2、DeepSeek-V4-Pro。

评测协议

动作契约:agent 每轮只能回一个 JSON action,由 runner 在容器内执行。

{"command":"find /workspace -maxdepth 3 -type f","reason":"Inspect the available workspace files"}

结束方式:

{"finish":true,"reason":"The requested artifact has been verified"}

三个指标:

指标符号计算含义
Partial pass rateP任务级原子检查通过比例(均值)确定性需求覆盖率
Judge scoreJartifact 级 LLM Judge 的宏平均产物的正确性/完整性/质量
Final scoreF0.3P + 0.7J榜单主分数
  • P 的原子检查覆盖:产物存在性与路径、格式合法性、必需/禁止内容、文档结构、表格数值与公式、受保护文件完整性
  • J 的 rubric:每个受评 rubric 含 3–16 条原子标准(归一化权重),每条按 0–4 锚定打分并记录证据;cannot_assess 不计正分,产物缺失记 0 分;重复 judge 时按各标准得分取中位数
  • 评测器与参考文件在 agent 执行期间不可访问;run 或超时后冻结 workspace 再评

单题容器限额:2 vCPU / 8GB 内存 / 12GB 存储 / 1800 秒墙钟。基础镜像 python:3.12-slim 只装通用 shell、网络、PDF 与进程工具,任务专用依赖一律不预装(这就是 Insufficient 条件的来源)。

口径矛盾(提交前必须向维护者确认):论文与官网都写 F = 0.3P + 0.7J,但仓库 submissions/README.md 写的是「30% complete + 30% partial + 40% judge」。两者不可能同时成立,直接影响分数复现。

关键发现(论文)

  1. 严格全通过率很低:GPT-5.5 视图下 Partial(需求覆盖)77.0–90.3%,而 Judge 只有 65.7–77.7%;全 20 组配置里 Partial 最高 90.9%(DuMate+Opus-4.8)、Judge 最高 83.2%(同组合)。说明「把大部分步骤做对」与「交付质量高」之间有稳定落差
  2. harness 影响可高达 27 分:Opus-4.8 在 DuMate 下 0.8548、在 OpenClaw 下仅 0.5821。而 DeepSeek-V4-Pro 的跨 agent 极差只有 4.63 分——harness 与模型的匹配度决定榜位
  3. 基座模型均值排序:DeepSeek-V4-Pro 平均 Final 最高(0.8106),其次 GPT-5.5(0.7744)、Opus-4.8(0.7734)、GLM-5.2(0.7452)
  4. 质量与成本强烈背离:OpenCode + GPT-5.5 每题最省(273k token)但分最低(0.6906);DuMate + Opus-4.8 最高分(0.8548)却最慢(1039s/题)且耗 1.56M token
  5. DuMate 在 4 个基座模型上都是第一——见下方风险提示

局限性

  • 厂商自办且自己第一:DuMate 在全部 4 个基座模型下都排第一。虽然论文的 harness 分析本身有价值,但「自评第一」天然存在利益冲突,中文媒体也指出其公信力取决于后续第三方参与深度
  • Judge 占 70% 权重:最终分主要由 LLM Judge 决定,可复现性与抗操纵性弱于「跑测试」类基准(对比 SWE-bench 的测试判定)
  • 不是 coding 榜:Code 仅 88/200,且是办公交付语境下的编码,不能替代 SWE 类基准
  • 极新,生态未起:2026-08-27 首发;GitHub 仅 8 star / 0 fork,leaderboard/published.json 为空数组——榜上 5 条是论文自跑,尚无任何外部提交真正上站
  • 门槛不低:正式提交要求 ≥200 题 × 每题 ≥5 trials = 至少 1,000 次 rollout,加上 LLM Judge 调用
  • 数据集体积大:公开数据集压缩包约 3.5GB,且原始任务包不含 environment/,需用仓库 template_task 执行 dumate template fill 才能跑
  • 已知盲点(维护方自陈):Harbor 读 API 不暴露 job 的 created_by,CI 无法证明提交者本人产生了这个 job;当前缓解方案仍在讨论中

资源

相关页面

  • dumatebench — 分数快照(20 组配置 + 效率表)
  • dumatebench — 怎么跑、怎么提交、成本与坑
  • terminal-bench — 同类 harness 型榜(共用 Harbor 框架)
  • harbor — 官方执行框架,本基准与 Terminal-Bench 共用
  • coding-agent-leaderboards — 榜单横向地图(本页不属 coding 类)
  • toolathlon — 跨应用工具使用基准(同为 Agent 执行类)