Toolathlon 榜单(Verified)

评测集定义与方法论见 toolathlon。本页只放分数:各模型跨应用长程工具使用的能力强度。

官方榜(Toolathlon-Verified,抓取于 2026-08-13)

#模型权重Pass@1Pass@3Pass^3轮数工具调用日期
1Kimi K3 (max)开源76.5% ±1.983.368.522.839.12026-07
2Claude Opus 4.8 (max)闭源76.2% ±3.484.366.719.936.32026-06
3Muse Spark 1.2 (xhigh)闭源75.9% ±1.387.063.044.248.62026-08
4GPT-5.5 (xhigh)闭源73.5% ±1.282.462.024.437.82026-06
5DeepSeek V4 Flash 0731 (max)开源70.7% ±0.981.558.326.349.02026-07
6Gemini 3.5 Flash (high)闭源67.3% ±1.279.653.745.345.62026-06
7GLM 5.2 (max)开源59.9% ±1.978.741.723.341.92026-06

注:DeepSeek V4-Flash 发布材料写 70.3,官方榜单为 70.7(不同次运行)。轮数/调用数差异大(Muse Spark 44.2 轮 vs Opus 19.9 轮)说明各家 agent 策略风格迥异。

分数观察

  1. 8 个月翻倍:38.6%(2025-10 论文时点,Claude-4.5-Sonnet;开源最强 DeepSeek-V3.2-Exp 仅 20.1%)→ 76.5%(2026-07)
  2. 开源权重登顶:Kimi K3 拿下第一,与 SWE-bench Verified/Vibe Code Bench 上开源追赶的趋势一致
  3. Pass^3 只有 68.5%(榜首)——三次全对的可靠性仍是短板
  4. 轮数即成本:同一分数段下轮数差 2 倍多(19.9 vs 44.2),选模型要看效率不只是正确率