Agent Harness 工程化综述,提出 ETCLOVG 七层分类体系,映射 170+ 开源项目,核心论断:任务可靠性取决于 Harness 层质量而非底层模型,OpenReview。

核心论断

生产中 LLM Agent 的任务执行可靠性,取决于包裹模型的基础设施层(Agent Harness)工程质量,而非底层模型本身。

围绕三个核心主张展开:

  1. Agent Harness 是独立的系统层,其工程质量驱动了现实世界可靠性的大部分
  2. ETCLOVG 七层分类体系:比此前六组件框架扩展了 Observability 和 Governance 为独立架构关注点
  3. 170+ 开源项目映射到分类体系,暴露生态模式、覆盖空白和新兴设计原则

工程演进三阶段

Prompt Engineering → Context Engineering → Harness Engineering

每个阶段都是对上一个阶段能力边界的突破。

ETCLOVG 七层分类体系

层英文职责
EExecution Environment执行环境:沙箱、容器、权限隔离
TTool Interface工具接口:外部工具调用、API 集成
CContext Management上下文管理:记忆、压缩、检索
LLifecycle / Orchestration生命周期/编排:多步任务规划、子 Agent 调度
OObservability可观测性:日志、追踪、指标(新增独立层)
VVerification验证:输出验证、安全检查
GGovernance治理:权限、审计、合规(新增独立层)

三大工程权衡

  • Cost-Quality-Speed Trilemma:成本/质量/速度三角
  • Capability-Control Tradeoff:能力越强越难控制
  • Harness Coupling Problem:Harness 与具体 Agent 实现耦合度管理

来自生产实践的工程原则

综合 OpenAI、Anthropic、LangChain 的生产部署经验,填补从业者知识与研究词汇之间的鸿沟。

与已有 wiki 内容的关系

资源