Berkeley 出品的 AI Agent 经济价值评估基准,聚焦长视野真实职业工作流,1000+ 任务覆盖 55 子领域/13 行业集群,当前最强配置平均通过率仅 2.6%,设计为持续演进的活跃 Benchmark。
核心主张
现有 benchmark 与经济部署之间存在巨大鸿沟:AI 系统在竞赛数学、Olympiad 编程等抽象 benchmark 上表现优异,但这些进步并未转化为跨专业领域的实际经济产出。
本文认为这本质是评估问题:广泛使用的 benchmark 缺乏对真实且经济价值可测量工作流的持续性能衡量。
ALE 设计原则
| 维度 | 设计选择 |
|---|---|
| 任务来源 | 250+ 行业专家合作构建,真实职业工作流 |
| 任务性质 | 长视野(long-horizon),可验证结果(verifiable outcomes) |
| 覆盖范围 | O*NET / SOC 2018 美国联邦职业分类体系的非体力劳动行业 |
| 规模 | 55 子领域 → 13 行业集群 → 1000+ 任务 |
| 评分机制 | 细粒度评分 + 全通过率(full pass rate) |
| 演进性 | 活跃 benchmark,任务池随新工作流/行业持续增长 |
任务执行要求
ALE 任务来自真实职业计算机环境,典型特征:
- Shell 命令 + GUI 应用 + 文件操作 + Web 研究交织进行
- 需要 Generalist CUA-Agent(GCUA) 配置:Brain / Eyes / Body / Hands / Feet 五层能力全覆盖
- 评估采用 GUI-as-Tool 模式:统一 CUA MCP 桥暴露 14 个桌面动作工具,单一基础模型同时处理 Shell 输出和视觉反馈
实验结果
- 每次运行上限 5 小时;整体超时率 4.3%(CLI 轻量级 harness ~1%,OpenClaw ~7%)
- 最难层级远未饱和:主流 harness + backbone 配置平均 full pass rate 仅 2.6%
- ALE-CLI 子集(103 个 Linux-only 任务)对比 TerminalBench:任务难度更高、Session 更长
评估覆盖的系统类型:
- (a) 主流 harness-backbone 配置
- (b) 固定 harness=OpenClaw+GUI-as-Tool,扫描不同模型
- (c) 固定 backbone=GPT-5.5,扫描不同 harness
- (d) 固定 backbone=Claude Opus 4.7,扫描不同 harness
- (e) ALE-CLI:ForgeCode / Hermes / Terminus 等 CLI-only agent
与现有 Benchmark 对比
| 维度 | ALE | SWE-bench | GAIA | TerminalBench |
|---|---|---|---|---|
| 任务来源 | 真实职业工作流 | GitHub Issues | 通用助手任务 | 终端任务 |
| 视野长度 | 长(数小时) | 中 | 短 | 中 |
| 经济相关性 | 直接(职业分类体系) | 软件工程 | 通用 | 系统管理 |
| 结果可验证 | 是 | 是 | 部分 | 是 |
| 当前饱和度 | 极低(2.6%) | 较高 | 较高 | 中等 |
关联
- agent-protocols — Agent 协议层设计与评估
- meta-harness — 与 Stanford meta-harness 框架的关联(harness 性能差异)
- opensources/openclaw — OpenClaw 作为 ALE 评估 harness 之一(超时率 ~7%)