Toolathlon 榜单(Verified)
评测集定义与方法论见 toolathlon。本页只放分数:各模型跨应用长程工具使用的能力强度。
官方榜(Toolathlon-Verified,抓取于 2026-08-13)
| # | 模型 | 权重 | Pass@1 | Pass@3 | Pass^3 | 轮数 | 工具调用 | 日期 |
|---|---|---|---|---|---|---|---|---|
| 1 | Kimi K3 (max) | 开源 | 76.5% ±1.9 | 83.3 | 68.5 | 22.8 | 39.1 | 2026-07 |
| 2 | Claude Opus 4.8 (max) | 闭源 | 76.2% ±3.4 | 84.3 | 66.7 | 19.9 | 36.3 | 2026-06 |
| 3 | Muse Spark 1.2 (xhigh) | 闭源 | 75.9% ±1.3 | 87.0 | 63.0 | 44.2 | 48.6 | 2026-08 |
| 4 | GPT-5.5 (xhigh) | 闭源 | 73.5% ±1.2 | 82.4 | 62.0 | 24.4 | 37.8 | 2026-06 |
| 5 | DeepSeek V4 Flash 0731 (max) | 开源 | 70.7% ±0.9 | 81.5 | 58.3 | 26.3 | 49.0 | 2026-07 |
| 6 | Gemini 3.5 Flash (high) | 闭源 | 67.3% ±1.2 | 79.6 | 53.7 | 45.3 | 45.6 | 2026-06 |
| 7 | GLM 5.2 (max) | 开源 | 59.9% ±1.9 | 78.7 | 41.7 | 23.3 | 41.9 | 2026-06 |
注:DeepSeek V4-Flash 发布材料写 70.3,官方榜单为 70.7(不同次运行)。轮数/调用数差异大(Muse Spark 44.2 轮 vs Opus 19.9 轮)说明各家 agent 策略风格迥异。
分数观察
- 8 个月翻倍:38.6%(2025-10 论文时点,Claude-4.5-Sonnet;开源最强 DeepSeek-V3.2-Exp 仅 20.1%)→ 76.5%(2026-07)
- 开源权重登顶:Kimi K3 拿下第一,与 SWE-bench Verified/Vibe Code Bench 上开源追赶的趋势一致
- Pass^3 只有 68.5%(榜首)——三次全对的可靠性仍是短板
- 轮数即成本:同一分数段下轮数差 2 倍多(19.9 vs 44.2),选模型要看效率不只是正确率