一句话定位:“工具十项全能”——32 个真实软件应用、604 个 MCP 工具、108 道长程跨应用任务的 agent 工具使用基准(HKUST NLP 主导,联合 All Hands AI/CMU/Duke,ICLR 2026);Verified 是 2026-06-30 发布的当前版本,修任务、修基建、保评测可靠性。

为什么值得关注

  • 打的是现有 agent 基准三大硬伤:领域窄(单工具/单 API)、任务假(一两步调用完事)、环境假(空白初始状态)——本基准要跨应用多步协作,且初始环境是真实软件状态(几十个学生的 Canvas 课程、真实财务表格等)
  • 严格可验证:每题有专门评测脚本做 execution-based 判分,没有 LLM judge 的主观空间
  • 全链路开源:任务/工具/评测脚本开源,连 17 个模型 × 3 次的完整执行轨迹(5000+ 条)都放出来了,可审计可分析
  • 进步曲线陡峭且诚实:论文时点 SOTA 38.6%,8 个月后 76.5%——真实长程工具使用是当前 agent 的核心瓶颈也是主战场

评测集构成

项说明
应用/工具32 个软件应用、604 个工具:日常向(Google Calendar、Notion)到专业向(WooCommerce、Kubernetes、BigQuery);多数基于高质量 MCP server(团队修订或自研)
任务108 道人工搜集/设计,平均需 ~20 轮交互、跨多个应用
任务示例NVIDIA 机构持股 8 季度趋势分析→拆股调整→填 xlsx;发票核验报销单;W&B runs 汇总同步进 Notion;各城市 SQLite 库存同步到 WooCommerce;Canvas 收作业→运行判对错→打分;K8s 部署 PR 预览分支;国米 UCL 决赛数据填 Google Sheets
评分Pass@1(主指标)+ Pass@3 + Pass^3(一致性)+ 平均轮数/工具调用数
发布方HKUST NLP(Junlong Li 等 21 人)+ All Hands AI + CMU + Duke

版本线:

版本时间说明
Toolathlon v12025-10-29论文发布(arXiv:2510.25726),SOTA Claude-4.5-Sonnet 38.6%(平均 20.2 轮工具调用),开源最强 DeepSeek-V3.2-Exp 仅 20.1%
v2 论文修订2026-02-26论文更新
Toolathlon-Verified2026-06-30当前版本:大量任务与支撑基建修订以保证任务正确性和评测可靠性,经大量实验验证

排行榜

模型分数见 toolathlon(Toolathlon-Verified 官方榜快照,榜首 Kimi K3 76.5%)。

设计层面观察:Verified 修订与 swe-bench-verified、Terminal-Bench 2.1 同款动作——第一代基准普遍存在任务缺陷/评测不稳,社区进入”验证修订”阶段。

局限性

  • 108 题规模小,单题波动可见(stderr ±1-3.4%)
  • 任务以信息处理/办公自动化为主,不覆盖纯软件工程(见 swe-bench-verified)和从零建应用(见 vibe-code-bench)
  • MCP server 实现质量本身会引入环境噪声(Verified 修订主要解决这个)

资源

相关页面