一句话定位:国内影响力最大的第三方中文大模型综合测评体系(CLUE 组织出品)——月度发布中文通用模型综合榜,题库每两个月 100% 替换且全部原创防污染,另有一大族中文专项子基准(法律/金融/医疗/软件工程/长文本/安全……)。
为什么值得关注
- 中文向补位:本系列前九个评测集全是英文向,中文能力(指令遵循、中文幻觉、中文场景 SWE)只能靠这类本土基准衡量
- 三条立身主张:①”Live”更新零污染——题库定期(每两个月)100% 替换、全部原创;②测评方式与真实用户交互一致,任务贴近落地场景;③独立第三方、不研发自家模型
- 月度节奏 + 快速跟进新形态:除通用榜外还有智能体产品榜(XClaw 龙虾产品测评)、图像编辑榜等专项,跟进行业热点快
- 被国内主流媒体广泛引用(千问/DeepSeek/豆包每次发版几乎都有 SuperCLUE 数字)
主榜评测体系(SuperCLUE 通用基准)
2026-07 版六维加权(本期升级:传统代码生成→智能体编程):
| 维度 | 权重 |
|---|---|
| 智能体编程 | 25% |
| 数学推理 | 18% |
| 科学推理 | 16% |
| 精确指令遵循 | 16% |
| 幻觉控制 | 16% |
| 智能体任务规划 | 9% |
排行榜
月度榜单见 superclue(2026-07 期:Qwen3.8-Max 71.48 登顶、Kimi K3 70.68 第二;另含 XClaw 智能体产品榜与图像编辑榜快照)。
子基准家族(站点公开列表节选)
- 通用/推理:SuperCLUE-Hard(困难版)、-Reasoning(高阶推理)、-CoT(链式推理)、-Science(科学推理)、MathCLUE/Math24o/Math6o(高中奥数)
- 工程/代码:SuperCLUE-SWE(中文软件工程,含 Claude Code 中文场景)、-WebCoding(Web 开发)、-Code3(等级化代码)
- 领域:-Law(法律)、-Fin(金融)、-MedAssist(医疗助手)、-Auto(汽车)、-ICabin(智能座舱)、-Industry(工业)、-Mkt/-AdsVU(广告营销/视频理解)
- 能力专项:-LongContext/-Long/-200K(长文本/超长上下文)、-RAG、-Agent、-CPIF(精准指令遵循)、-Faith/-Fact(忠实性/事实性幻觉)、-Safety/-DSPSafeBench(安全/对抗)、-TTS、-OnDevice(端侧)、-AISearch、-Role(角色扮演)、-Writing(创意写作)
- 产品测评线:XClaw 龙虾产品测评(智能体产品:文心助手 97.62 居首)、中文原生图像编辑测评(2026-03:GPT-Image-1.5 总榜第一 87.03、腾讯混元国内第一 83.00)
怎么读这个榜(与系列内英文基准的差异)
- 分数是 0-100 加权综合分,机构自有口径,与英文基准分数不可比、也不与自家历史版本跨期硬比(维度权重会调,如 2026-07 智能体编程升至 25%)
- 题库不公开:原创题+定期全换是防污染卖点,但外部无法审计题目与判分细节;无论文,方法论透明度低于学术基准
- 参测以国产模型为主:海外模型覆盖有限,定位是”中文场景国产模型横评”而非全球榜
- 厂商发布会引用频繁,但注意期数与维度版本(同模型不同期分数差异可能来自题库更换或权重调整)
局限性
- 非公开题库 + 无公开判分器,不可复现
- 加权总分掩盖单项差异,读报告需看分维度
- 月榜波动大(题库轮换 + 参测配置差异)
资源
- 官网:https://www.superclueai.com/homepage(通用榜/专项榜/产品榜入口,模型参测申请走邮件)
- 评测报告发布渠道:官方微信公众号(站点报告均以公众号文章形式发布)
相关页面
- superclue — 本体系榜单快照
- swe-bench-verified — SuperCLUE-SWE 对应的英文原版能力维度
- humanitys-last-exam — 同为”综合/通用”定位(英文知识向 vs 中文能力向)
- vibe-code-bench — SuperCLUE-WebCoding 对应的从零建应用维度