一句话定位:评测模型”从零到一构建完整 Web 应用”能力的 agentic 编码基准——不是解算法题、修 bug,而是给一份自然语言产品 spec,看模型能否在真实开发环境里交付一个可通过点击测试的可用应用。

为什么值得关注

  • 瞄准 AI coding 最值钱的场景:从自然语言规格直接产出完整应用(zero-to-one),而非 SWE-bench/Terminal-Bench 那类孤立编程问题
  • 评测方式是 point-and-click 端到端测试:用 browser-use 自主 web agent 像真实用户一样操作生成的应用并逐步验证
  • 已发表同行评审论文(ACM CAIS ‘26,arXiv:2603.04601),方法论透明
  • 版本迭代快、头部模型重跑,是观察 frontier 模型 app-building 能力进展的好窗口(v1 榜首 41.31% → v1.1 榜首 90.35%,半年翻倍)

评测集构成

项说明
任务形态每个任务 = 一份应用 spec(非技术自然语言、一页以内、MVP 导向、不指定技术栈)+ 配套测试套件
Spec 来源LLM 生成初稿,灵感来自真实咨询案例/自由职业开发任务/创业应用模式;经专业 PM 和工程师多轮评审
测试每份 spec 配 20-60 条自动化测试,覆盖核心功能/边界/关键用户流;每条测试经工程师三重验证(能测对、好的实现能过、坏的实现会挂)
示例任务”Zeeter”(类 Twitter 微博客:注册登录/发帖/关注/点赞评论/搜索/探索页)、Breathing Exercise App(较简单的对照任务)
数据可见性专有(Proprietary):非公开数据集,Vals AI 与行业专家构建;访问计划逐步开放(需在官网填表申请)

评测环境与方法

  • Harness:基于 browser-use 生态的修改版 OpenHands agentic coding 框架,Docker-in-Docker 隔离容器,模型拥有完整终端权限(装依赖/构建/起服务)
  • 配套服务:自托管 Supabase(认证/数据库/文件存储)、Stripe 测试模式(支付)、MailHog(邮件)、web 浏览;API key 全部预配置
  • 预算:每个应用最多 5 小时 / 1000 轮
  • 工具:提供 30+ 工具(Supabase 状态管理、浏览自己跑起来的应用、web 搜索等),但实际使用高度集中——前 4 名:文件编辑、bash、SQL 执行、浏览器(实现后自测)
  • 评分:Browser Use agent 执行自然语言测试(点按操作),每条测试由多个 substep 组成;单个应用得分 = 至少 90% substep 成功的测试占比;总分 = 各应用得分平均。评测成本约 $10-20/应用
  • 校准:专业工程师按同标准人工抽测子集做对齐研究

排行榜

模型分数见 vibe-code-bench(v1.1 canonical 数据快照,榜首 Claude Fable 5 90.35%)。

关键发现(任务行为)

常见失败模式(人工检查 trajectory 归纳):

  • 安装依赖命令首次尝试频繁失败(好模型 2-3 次内修复,差模型反复浪费轮次)
  • Docker 网络配置:前端拿不到 Supabase/后端 endpoint(正解是 .env 或 build.args,env_file 只管运行时变量,很多模型卡死在此)
  • 超时:差模型改文件改到时间耗尽,结束时应用不可用
  • 过早放弃:轮次还很多就调用 finish 提交
  • 指令遵循:忘掉初始 prompt 的关键要求

v1 → v1.1 变更(2026-02-24 发布)

  • 数据:认证 spec 标准化;明确评测用邮箱避免碰撞;部分 feature 的 spec 描述更清晰;Stripe 测试支付信息说明改进
  • 评测:Browser Use evaluator 新增工具(更好处理 date picker 等控件)、改进等待能力、支持评测中使用 csv/jpg/png/pdf 等文件
  • 所有模型用 v1.1 harness 和数据从零重跑

注:官网 v1.1 发布段落写 “February 24, 2025”,但结合”v1 时代(2026-02)榜首 41.31%“的描述,年份应为 2026,疑为笔误。

局限性

  • 数据集不公开,第三方无法复现;访问需申请
  • 单 harness(OpenHands)定榜,模型分数与 harness 绑定(Claude Code harness 单列一条,分数明显更低)
  • 评测成本 $10-20/应用 + 模型调用费,重跑门槛高
  • UI 测试由 LLM evaluator 执行,存在评测器自身误差(官方以人工抽测做对齐校准)

资源

  • 官方榜单页:https://www.vals.ai/benchmarks/vibe-code(含 Pareto 曲线、应用示例托管、评测过程回放、trajectory 分析)
  • 论文:Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development(ACM CAIS ‘26),https://arxiv.org/abs/2603.04601
  • Zeeter spec 与评分 rubric 在官网页面内链接;示例应用托管(GPT-5.2 / Codex / Opus 4.6 / Sonnet 4.6 / Kimi K2.5 Thinking 各版本)

相关页面

  • vibe-code-bench — 本基准榜单快照
  • swe-bench-verified — SWE-bench Verified:修真实仓库 bug 的事实标准基准(本基准排名与其不迁移)
  • 2605.10912_wildclaw-bench — WildClawBench:真实长时域 Agent 基准(另一种评测形态)
  • browser-use — 本基准 UI 测试所用的自主 web agent
  • meta-harness — Terminal-Bench 相关的 Harness 优化框架(本基准致谢 Terminal-Bench 团队)
  • terminal-bench — Terminal-Bench:终端环境任务基准(本基准观察到与其排名不迁移)
  • 2606.05405_agents-last-exam — Agents’ Last Exam:另一个长视野 Agent 基准
  • humanitys-last-exam — HLE:知识前沿闭卷考(同系列评测集)
  • codeforces — Codeforces rating:竞赛编程口径(同系列评测集)
  • dsbench-fullstack — DeepSeek 内部全栈测试集(能力维度与本基准最接近的内部私有基准)
  • toolathlon — Toolathlon:跨应用长程工具使用基准(同系列评测集)
  • deepswe — DeepSWE:原创长时域 SWE 基准(同为对抗榜饱和的新一代设计)