Harrison Chase(LangChain 创始人)提出:agent 持续学习不只是更新模型权重,而是在 Model / Harness / Context 三层上分别进化的系统工程问题。

三层定义

层定义学习频率成本
Model底层模型权重(SFT/RL/LoRA)低频高,平台级
Harness驱动模型运行的外壳(系统提示、工具暴露、调用循环、截断策略)中频工程驱动,可评测
Contextharness 外部可配置上下文(memory files、skills、用户偏好、团队规则)高频低,业务驱动

实例映射

系统ModelHarnessContext
Claude CodeClaude Sonnet 等Claude Code 本身CLAUDE.md、/skills、mcp.json
openclaw多模型Pi + 运行脚手架SOUL.md + ClawHub skills

Harness 层:Meta-Harness 模式

让 agent 帮你改 agent 的自动优化循环:

  1. 在标准任务集上运行 agent,收集执行日志与得分
  2. 把历史候选、源代码、完整 traces 保存在文件系统
  3. 让 coding agent 阅读这些材料,提出 harness 改动候选
  4. 评测新 harness,继续迭代

关键差异:让优化器看到完整历史代码 + 分数 + 执行 trace,而不是只看摘要。

参考:Meta-Harness

Context 层:分层记忆系统

Context 不是”多塞一点提示词”,而是可持久化、可分层、可读写、可检索的记忆系统:

  • agent-scoped memory:所有用户共享同一份 agent 记忆
  • user-scoped memory:每个用户拥有独立记忆
  • 在线更新:会话中直接写入
  • 后台整理:会话外做 consolidation
  • skills 作为程序性记忆,按需加载

Traces 是统一燃料

没有高质量 traces,就没有高质量 agent learning loop:

  • 改 Model → traces 作为训练/偏好数据来源
  • 改 Harness → traces 作为失败诊断材料
  • 改 Context → traces 作为经验提取素材

落地优先级

  1. 先把 traces 做对:统一记录任务输入、工具调用、关键中间状态、输出结果、人工反馈
  2. 优先做 Context learning:用户偏好、团队规则、术语表、操作 SOP
  3. 建立 Harness optimization loop:A/B 评测 + coding agent 辅助改动 + 回滚机制
  4. 最后才考虑 Model-level learning:积累足够 traces 且 harness/context 优化逼近上限后

判断框架(四问)

遇到”agent 该怎么学”时先问:

  1. 要改的是模型能力、运行机制,还是可配置记忆?
  2. 改动应作用在 agent、user 还是 org 作用域?
  3. 更新应在运行中即时发生,还是离线整理后再生效?
  4. 有没有足够完整的 traces 支持评估学习效果?

范式转移的三个维度

1. 学习目标:从权重转向系统行为

传统 LLM 持续学习关注 loss/benchmark,agent 持续学习关注:

  • 是否更会使用工具、规划步骤
  • 是否更能从过去失败里改进执行策略
  • 是否更了解当前用户/团队/组织的偏好

2. 学习单位:从单模型转向分层架构

同一 agent 系统里,不同层的学习频率与代价完全不同(见三层定义表)。持续学习不该只有一个总开关,而应该是三套不同机制。

3. Traces 成为统一燃料

  • 改 Model → traces 作为训练/偏好数据来源
  • 改 Harness → traces 作为失败诊断材料
  • 改 Context → traces 作为经验提取素材

2026 年竞争格局判断

如果 2024 年大家主要比拼”谁先把 agent 跑起来”,那么 2026 年更像是在比:

  • 谁的 harness 更稳
  • 谁的 traces 更完整
  • 谁的评测与回放体系更闭环
  • 谁能更快把失败案例沉淀为下一版 agent 行为改进

Context 层会最先大规模落地(不需要训练 infra、对业务回报最直接、易于权限管理和回滚)。Harness 层是下一轮 agent 基建竞争焦点。

相关