将 Agent Harness 表示为可执行的自然语言文档(NLAH),通过共享运行时 IHR 解释执行,在编码/终端/计算机使用基准上效果与代码实现相当,同时 Harness 策略更短、可分析,arXiv:2603.25723。

核心问题

Agent 的 Harness(组织任务运行的外部执行系统)通常埋在紧耦合的控制器代码中,难以:

  • 检查(inspect)
  • 对比(compare)
  • 迁移(transfer)
  • 消融实验(ablate)

本文的问题:Agent Harness 的可复用设计模式,能否表示为可执行的自然语言对象?

提出方案

NLAH(Natural-Language Agent Harnesses)

可编辑的文档,描述”运行级别的 Harness 策略”(run-level harness policy)。

IHR(Intelligent Harness Runtime)

共享运行时,将 NLAH 文档解释/执行为:

  • Agent 调用(agent calls)
  • 任务切换(handoffs)
  • 状态更新(state updates)
  • 验证门控(validation gates)
  • 产出物契约(artifact contracts)

核心思路

传统方式:Harness 逻辑嵌在代码 controller 中(不可迁移、难消融)
本文方案:Harness = 自然语言文档(NLAH)+ 共享运行时(IHR)解释执行

类比:Harness as Code → Harness as Document

这与 agent-skill-loading 的 Skill as Markdown 思路高度相似——把运行逻辑从代码提升为可读文档。

实验结果

在三类基准上(编码、终端使用、计算机使用):

  • IHR 执行的 NLAH ≈ 代码实现效果(task outcomes 相当)
  • NLAH 的静态 Harness 策略描述更短
  • 模块消融实验表明显式 Harness 模块是可分析的

意义

Agent harnesses 可以从”模型周围的意外胶水代码”转变为科学表示对象。

  • Harness 策略可以独立于代码存在、版本化、共享、实验
  • 为 Harness 工程提供可组合的基本单元

与 wiki 其他内容的关系

作者

Linyue Pan, Lexiao Zou, Shuo Guo, Jingchen Ni, Hai-Tao Zheng

资源