Stanford 出品的 Harness 自动优化框架:给 coding agent 一个包含所有历史候选源码、execution traces、分数的文件系统,让它自主诊断失败并提出改进,实现 end-to-end harness 优化。
为什么值得关注
大多数 LLM 优化方法(OPRO、TextGrad、MIPRO 等)把历史压缩成摘要或标量分数,每步可用诊断上下文最多 26K tokens。Meta-Harness 的核心洞察是:harness 工程的失败往往需要看原始 execution trace 才能诊断,而不是猜分数。
它给优化器一个文件系统,包含所有历史候选的完整源码 + traces + 分数,让 coding agent 通过 grep/cat 自由读取,每步可用上下文高达 10M tokens。
搜索循环
① Agent 读取文件系统(历史源码 + traces + 分数)
② 反事实诊断:找到导致失败的具体 harness 决策
③ 提出新 harness 改动
④ 在 held-out 任务上评测
⑤ 所有日志存入文件系统 → 回到 ①
Proposer 使用 Claude Code,通过标准工具(grep、cat)按需读取,而不是被动接收压缩摘要。
与其他方法对比
| 方法 | 历史范围 | 日志内容 | Mtok/iter |
|---|---|---|---|
| Self-Refine | Last | output + self-critique | 0.001 |
| OPRO | Window | (solution, score) pairs | 0.002 |
| MIPRO | Summary | bootstrapped traces | 0.003 |
| GEPA | Summary | rollout traces | 0.008 |
| AlphaEvolve | Window | program database + scores | 0.022 |
| Meta-Harness | Full | all logs and scores | 10.0 |
关键差异:Meta-Harness 是唯一给优化器完整历史的方法,且通过文件系统接口让 agent 按需读取,而不是塞进单个 prompt。
实验结果
文本分类(LawBench / Symptom2Disease / USPTO-50k)
- 最佳发现 harness(Label-Primed Query):48.6% vs ACE 40.9%,+7.7 点
- 使用 4x 更少 context tokens
- 大标签空间任务收益最大:LawBench(215类)+16 点
数学推理(IMO 级别,200 题)
- 单个发现的 retrieval harness 在 5 个 held-out 模型上平均 +4.7 点(34.1% → 38.8%)
- 超过 BM25 retrieval +1.3 点,且 harness 可跨模型迁移
Agentic Coding(TerminalBench-2,89 任务)
- Claude Opus 4.6:76.4%,排名 #2(仅次于 ForgeCode 81.8%)
- Claude Haiku 4.5:37.6%,排名 #1
- 10x 更少评测次数即可达到其他方法的最终精度
核心洞察
- 文件系统 > 压缩摘要:失败诊断需要原始 trace,标量分数无法定位根因
- 按需读取 > 固定 prompt:agent 自主决定读什么,避免无关信息干扰
- Harness 优化 ≠ 模型微调:不改权重,只改”模型怎么被使用”,效果显著
- 发现的 harness 可迁移:在一组模型上搜索,在其他模型上同样有效
与 Agent 持续学习框架的关系
Meta-Harness 是 agent-continual-learning 中 Harness 层学习的具体工程实现:
- 对应”让 coding agent 读取 traces,辅助提出 harness 改动候选”
- 验证了”traces 是统一燃料”的核心判断
- 提供了 Harness optimization loop 的可复现参考实现
相关
- agent-continual-learning — Harrison Chase 的三层框架,Meta-Harness 是 Harness 层的典型实现
- darwin-skill — Skill 自动进化系统,与 Meta-Harness 思路相似但作用于 Context 层
- 2604.14228_dive-into-claude-code — Claude Code 被用作 Meta-Harness 的 proposer agent