论文:WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation 作者:Shuangrui Ding et al. (Shanghai AI Laboratory / CUHK / Fudan / USTC) 发布:2026-05-11 | arXiv:2605.10912
核心问题
现有 Agent 基准的四大缺陷:
- 合成沙箱而非真实运行时(WebArena、OSWorld 等)
- 短时域任务(< 1 分钟完成)
- Mock API 替代真实工具调用
- 仅检查最终答案,不审计轨迹和副作用
WildClawBench 同时解决这四个问题。
基准设计
规模与结构
- 60 个任务,人工编写,双语(36 英文 + 24 中文),26 个多模态任务
- 6 个类别:生产力流程 / 代码智能 / 社交互动 / 搜索检索 / 创意合成 / 安全对齐
- 时间预算:300–1200 秒/任务,均值 881 秒
- 实际耗时:Claude Opus 4.6 下平均 8.5 分钟、26 次工具调用
支持的 Harness
- openclaw(默认)
- Claude Code
- Codex
- Hermes Agent
每个 Harness 打包为独立 Docker 镜像,固定 OS、Python 工具链、预装二进制(browser、ffmpeg、git 等)。
评分策略(三层混合)
- 规则检查:文件存在性、格式、数值精度、字符串匹配、工作区清洁度
- 环境状态审计:邮件/日历/聊天 API 的操作日志,安全任务的危险操作拒绝验证
- LLM/VLM 裁判:叙事报告、生成图像、视频片段等无法精确匹配的输出
数据构建流程(4 阶段)
- 任务编写:8 名研究员 × 2 周,要求长时域 + 多工具编排 + 可验证副作用
- 参考答案构建:人工专家预先构建 grading point
- 任务过滤:模型得分差 ≥ 0.2(避免天花板/地板效应)+ 人工审核
- 迭代精炼:修订 prompt、rubric、grader,增强干扰项
实验结果
主要发现(19 个前沿模型,OpenClaw harness)
| 模型 | 总分 |
|---|---|
| Claude Opus 4.7 | 62.2% |
| 其余所有模型 | < 60% |
| 最低分 | 19.3% |
| 分数跨度 | 43 个百分点 |
关键结论
- Harness 影响巨大:同一模型换 Harness 最多差 18 分(MiMo V2 Pro: Claude Code vs Hermes Agent)
- 多模态任务更难:GPT 5.4 多模态 40.2% vs 纯文本 58.0%;Claude Opus 4.7 多模态 58.5% vs 纯文本 65.0%
- 时间预算和可用 Skill 也影响得分
- 结论:Scaffold、工具使用、轨迹、产出物都是被评测系统的一部分,不是实现细节
与其他基准对比
| 基准 | 跨模态 | 可审计 | 原生运行时 | 双语 | 可复现 | 验证方式 |
|---|---|---|---|---|---|---|
| SWE-bench | ✗ | △ | △ | ✗ | ✓ | Exec |
| WebArena | △ | △ | ✗ | ✗ | ✓ | State |
| OSWorld | ✓ | ✓ | △ | ✗ | ✓ | Hybrid |
| Claw-Eval | ✓ | ✓ | △ | ✓ | ✓ | Hybrid |
| WildClawBench | ✓ | ✓ | ✓ | ✓ | ✓ | Hybrid |
六类任务详解
- 生产力流程(10):arXiv 摘要聚合、PDF 批量分类、LaTeX 表格提取、邮件排期
- 代码智能(12):无文档代码库理解、SAM3 推理脚本、视觉谜题、benchmark 复现
- 社交互动(6):多轮多方邮件/聊天协调,时区冲突、权限约束
- 搜索检索(11):学术合作路径追踪、本地/网络信息矛盾消解、受限产品搜索
- 创意合成(11):足球比赛报告+剪辑、产品海报生成、英中视频配音、论文转海报
- 安全对齐(10):提示注入检测、git 历史凭证泄露、恶意 Skill 注入抵抗、危险命令拒绝
相关链接
- openclaw — 默认评测 Harness,得分最高
- agent-harness-anatomy — Agent Harness 六大组件解析
- 2604.14228_dive-into-claude-code — Claude Code 架构深度分析
- hermes-agent — 参与评测的 Hermes Agent