Berkeley 出品的 AI Agent 经济价值评估基准,聚焦长视野真实职业工作流,1000+ 任务覆盖 55 子领域/13 行业集群,当前最强配置平均通过率仅 2.6%,设计为持续演进的活跃 Benchmark。

核心主张

现有 benchmark 与经济部署之间存在巨大鸿沟:AI 系统在竞赛数学、Olympiad 编程等抽象 benchmark 上表现优异,但这些进步并未转化为跨专业领域的实际经济产出。

本文认为这本质是评估问题:广泛使用的 benchmark 缺乏对真实且经济价值可测量工作流的持续性能衡量。

ALE 设计原则

维度设计选择
任务来源250+ 行业专家合作构建,真实职业工作流
任务性质长视野(long-horizon),可验证结果(verifiable outcomes)
覆盖范围O*NET / SOC 2018 美国联邦职业分类体系的非体力劳动行业
规模55 子领域 → 13 行业集群 → 1000+ 任务
评分机制细粒度评分 + 全通过率(full pass rate)
演进性活跃 benchmark,任务池随新工作流/行业持续增长

任务执行要求

ALE 任务来自真实职业计算机环境,典型特征:

  • Shell 命令 + GUI 应用 + 文件操作 + Web 研究交织进行
  • 需要 Generalist CUA-Agent(GCUA) 配置:Brain / Eyes / Body / Hands / Feet 五层能力全覆盖
  • 评估采用 GUI-as-Tool 模式:统一 CUA MCP 桥暴露 14 个桌面动作工具,单一基础模型同时处理 Shell 输出和视觉反馈

实验结果

  • 每次运行上限 5 小时;整体超时率 4.3%(CLI 轻量级 harness ~1%,OpenClaw ~7%)
  • 最难层级远未饱和:主流 harness + backbone 配置平均 full pass rate 仅 2.6%
  • ALE-CLI 子集(103 个 Linux-only 任务)对比 TerminalBench:任务难度更高、Session 更长

评估覆盖的系统类型:

  • (a) 主流 harness-backbone 配置
  • (b) 固定 harness=OpenClaw+GUI-as-Tool,扫描不同模型
  • (c) 固定 backbone=GPT-5.5,扫描不同 harness
  • (d) 固定 backbone=Claude Opus 4.7,扫描不同 harness
  • (e) ALE-CLI:ForgeCode / Hermes / Terminus 等 CLI-only agent

与现有 Benchmark 对比

维度ALESWE-benchGAIATerminalBench
任务来源真实职业工作流GitHub Issues通用助手任务终端任务
视野长度长(数小时)中短中
经济相关性直接(职业分类体系)软件工程通用系统管理
结果可验证是是部分是
当前饱和度极低(2.6%)较高较高中等

关联

  • agent-protocols — Agent 协议层设计与评估
  • meta-harness — 与 Stanford meta-harness 框架的关联(harness 性能差异)
  • opensources/openclaw — OpenClaw 作为 ALE 评估 harness 之一(超时率 ~7%)

资源