评测体系与子基准家族见 superclue。本页只放分数:中文大模型综合能力强度。

主榜(2026-07 期,2026-08-06 发布,12 款国产模型,0-100 加权综合分)

#模型综合总分
1Qwen3.8-Max71.48
2Kimi K370.68(智能体编程单项第一 75.79)
3豆包 Doubao-Seed-2.1-pro65.95
4DeepSeek-V4-Flash65.6
5DeepSeek-V4-Pro64.4

(参考:2026-04 期 DeepSeek-V4-Pro 70.98 登顶、V4-Flash 68.82 第二——两期之间榜首易主,月榜波动不小)

专项榜快照

专项榜首分数日期
XClaw 龙虾产品测评(智能体产品,10 款)百度文心助手(任务模式)97.62(记忆维度满分)2026-08
中文原生图像编辑(19 模型)GPT-Image-1.587.03(国内第一:腾讯混元 83.00)2026-03

分数观察

  1. 加权综合分是机构自有口径:与英文基准分数不可比,也不与自家历史版本跨期硬比(维度权重会调,如 2026-07 智能体编程升至 25%)
  2. 月榜波动大:题库每两月 100% 轮换 + 参测配置差异,同模型不同期分数差异未必代表能力变化
  3. 参测以国产模型为主:海外模型覆盖有限,定位是中文场景国产横评而非全球榜
  4. 厂商发布会引用频繁,注意期数与维度版本