一句话定位:衡量 AI agent 在命令行终端环境里完成高价值复杂任务能力的基准(Stanford × Laude Institute 出品)——4.0 为 66 道容器内的真实工作流任务(编内核、配 git 服务器、破解 7z 密码、恢复 WAL 数据库、COBOL 现代化……),是当前 agent harness 军备竞赛的主战场之一。

为什么值得关注

  • 任务来自真实工作流:每道题有独立容器环境 + 人工编写解法 + 完备验证测试,覆盖 system-admin/security/data-science/model-training/coding 等域,比修 bug 更考验长时域操作能力
  • reward hacking 显式追踪:榜单单独列 reward hack 率(有模型高达 7-9%),是少数把”钻测试空子”当一等指标处理的基准
  • 榜单数据全开源:提交结果 JSON 直接放在 GitHub 仓库里(含 pass@k/成本/token/时长),可审计可复算
  • 配套 meta-harness 等 harness 优化研究都以本榜为标尺;衍生出 Terminal-Bench Challenges(长时单任务)和 terminal-bench-science(自然科学方向,开发中)

评测集构成

项说明
任务数4.0 为 66 道;历史版本 2.0/2.1 为 89 道,1.0 为 80 道
任务形态容器内终端任务:自然语言指令 + 专属 Docker 环境;例:build-linux-kernel-qemu(源码编内核并用 QEMU 启动)、configure-git-webserver、crack-7z-hash、openssl-selfsigned-cert、reshard-c4-data、train-fasttext、db-wal-recovery
验证每题人工写解法 + 综合测试自动判定;agent 容器与 verifier 容器隔离
运行框架Harbor(harbor-framework):评测/优化 agent 的统一 runner,支持云沙箱并行;数据与 job 托管在 Harbor Hub

版本演进:

版本时间变化
1.02025-05-19首发 80 任务(Laude Institute),早期 frontier agent 正确率普遍不高
2.02025-11-07扩到 89 任务并加难;论文(arXiv:2601.11868,2026-01 提交)报告当时最强模型/agent < 65%
2.12026-05-06加强验证的迭代:修 28 道题的 bug/超时资源/抗 reward hacking;榜单 2026-07-07 建立,现已饱和
3.02026-07-30收缩为 74 题 / 7 域,首次引入多容器、GPU、Lean、CAD 等新场景
4.02026-08-28收缩为 66 题,统一 8 小时超时,移除 8 道饱和/公开解法题。任务集与资源要求 breaking change,与 2.x/3.0 分数不可直接比较

排行榜

4.0 当前榜首 GPT-6 Astra Max + Codex 58.2%±2.8(2026-09)。历史 2.1 榜首为 Claude Fable 5 + Claude Code 83.8%,两者不可比。分数、成本与 reward hacks 详见 terminal-bench,横向读法见 coding-agent-leaderboards。

局限性

  • 单任务容器环境,任务间无状态延续(长时域连续工作流由 Terminal-Bench Challenges 补位)
  • 任务仍以工程/运维向为主,科研场景(terminal-bench-science)尚在开发
  • 任务规模小:4.0 仅 66 题,单题波动对总分影响可见;每任务 5 trials,官方报 95% 置信区间
  • 与 vibe-code-bench 一样存在跨榜排名不迁移现象(同一模型在不同基准相对位置差异大)

资源

相关页面

  • terminal-bench — 本基准榜单快照
  • harbor — 本基准的官方评测执行框架(Laude Institute / Stanford 出品)
  • meta-harness — Terminal-Bench-2 上拿过 #1/#2 的 Harness 自动优化框架
  • swe-bench-verified — 修 GitHub issue 基准(mini-SWE-agent 同时出现在两榜)
  • vibe-code-bench — 从零建应用基准(同样观察到跨榜排名不迁移)
  • humanitys-last-exam — HLE:知识前沿闭卷考(同系列评测集)
  • codeforces — Codeforces rating:竞赛编程口径(同系列评测集)
  • toolathlon — Toolathlon:跨应用长程工具使用基准(同为 agent 执行类主战场)
  • deepswe — DeepSWE:原创长时域 SWE 基准(同系列评测集)