Stanford 出品的 Harness 自动优化框架:给 coding agent 一个包含所有历史候选源码、execution traces、分数的文件系统,让它自主诊断失败并提出改进,实现 end-to-end harness 优化。

为什么值得关注

大多数 LLM 优化方法(OPRO、TextGrad、MIPRO 等)把历史压缩成摘要或标量分数,每步可用诊断上下文最多 26K tokens。Meta-Harness 的核心洞察是:harness 工程的失败往往需要看原始 execution trace 才能诊断,而不是猜分数。

它给优化器一个文件系统,包含所有历史候选的完整源码 + traces + 分数,让 coding agent 通过 grep/cat 自由读取,每步可用上下文高达 10M tokens。

搜索循环

① Agent 读取文件系统(历史源码 + traces + 分数)
② 反事实诊断:找到导致失败的具体 harness 决策
③ 提出新 harness 改动
④ 在 held-out 任务上评测
⑤ 所有日志存入文件系统 → 回到 ①

Proposer 使用 Claude Code,通过标准工具(grep、cat)按需读取,而不是被动接收压缩摘要。

与其他方法对比

方法历史范围日志内容Mtok/iter
Self-RefineLastoutput + self-critique0.001
OPROWindow(solution, score) pairs0.002
MIPROSummarybootstrapped traces0.003
GEPASummaryrollout traces0.008
AlphaEvolveWindowprogram database + scores0.022
Meta-HarnessFullall logs and scores10.0

关键差异:Meta-Harness 是唯一给优化器完整历史的方法,且通过文件系统接口让 agent 按需读取,而不是塞进单个 prompt。

实验结果

文本分类(LawBench / Symptom2Disease / USPTO-50k)

  • 最佳发现 harness(Label-Primed Query):48.6% vs ACE 40.9%,+7.7 点
  • 使用 4x 更少 context tokens
  • 大标签空间任务收益最大:LawBench(215类)+16 点

数学推理(IMO 级别,200 题)

  • 单个发现的 retrieval harness 在 5 个 held-out 模型上平均 +4.7 点(34.1% → 38.8%)
  • 超过 BM25 retrieval +1.3 点,且 harness 可跨模型迁移

Agentic Coding(TerminalBench-2,89 任务)

  • Claude Opus 4.6:76.4%,排名 #2(仅次于 ForgeCode 81.8%)
  • Claude Haiku 4.5:37.6%,排名 #1
  • 10x 更少评测次数即可达到其他方法的最终精度

核心洞察

  1. 文件系统 > 压缩摘要:失败诊断需要原始 trace,标量分数无法定位根因
  2. 按需读取 > 固定 prompt:agent 自主决定读什么,避免无关信息干扰
  3. Harness 优化 ≠ 模型微调:不改权重,只改”模型怎么被使用”,效果显著
  4. 发现的 harness 可迁移:在一组模型上搜索,在其他模型上同样有效

与 Agent 持续学习框架的关系

Meta-Harness 是 agent-continual-learning 中 Harness 层学习的具体工程实现:

  • 对应”让 coding agent 读取 traces,辅助提出 harness 改动候选”
  • 验证了”traces 是统一燃料”的核心判断
  • 提供了 Harness optimization loop 的可复现参考实现

相关