将 Agent Harness 表示为可执行的自然语言文档(NLAH),通过共享运行时 IHR 解释执行,在编码/终端/计算机使用基准上效果与代码实现相当,同时 Harness 策略更短、可分析,arXiv:2603.25723。
核心问题
Agent 的 Harness(组织任务运行的外部执行系统)通常埋在紧耦合的控制器代码中,难以:
- 检查(inspect)
- 对比(compare)
- 迁移(transfer)
- 消融实验(ablate)
本文的问题:Agent Harness 的可复用设计模式,能否表示为可执行的自然语言对象?
提出方案
NLAH(Natural-Language Agent Harnesses)
可编辑的文档,描述”运行级别的 Harness 策略”(run-level harness policy)。
IHR(Intelligent Harness Runtime)
共享运行时,将 NLAH 文档解释/执行为:
- Agent 调用(agent calls)
- 任务切换(handoffs)
- 状态更新(state updates)
- 验证门控(validation gates)
- 产出物契约(artifact contracts)
核心思路
传统方式:Harness 逻辑嵌在代码 controller 中(不可迁移、难消融)
本文方案:Harness = 自然语言文档(NLAH)+ 共享运行时(IHR)解释执行
类比:Harness as Code → Harness as Document
这与 agent-skill-loading 的 Skill as Markdown 思路高度相似——把运行逻辑从代码提升为可读文档。
实验结果
在三类基准上(编码、终端使用、计算机使用):
- IHR 执行的 NLAH ≈ 代码实现效果(task outcomes 相当)
- NLAH 的静态 Harness 策略描述更短
- 模块消融实验表明显式 Harness 模块是可分析的
意义
Agent harnesses 可以从”模型周围的意外胶水代码”转变为科学表示对象。
- Harness 策略可以独立于代码存在、版本化、共享、实验
- 为 Harness 工程提供可组合的基本单元
与 wiki 其他内容的关系
- openreview_agent-harness-engineering-survey 是这个方向的系统综述(ETCLOVG 七层),本文是其中 NLAH 具体实现方案
- agent-harness-anatomy 分析了 Harness 六组件,本文给出了让 Harness “变成文档”的实现路径
- agent-skill-loading 的 Skill as Markdown 模式与 NLAH 思路相通
- superpowers 中的 Skill 集就是一种 NLAH 的实践形态
作者
Linyue Pan, Lexiao Zou, Shuo Guo, Jingchen Ni, Hai-Tao Zheng
资源
- 论文:https://arxiv.org/abs/2603.25723
- 代码:暂未公开