Harrison Chase(LangChain 创始人)提出:agent 持续学习不只是更新模型权重,而是在 Model / Harness / Context 三层上分别进化的系统工程问题。
三层定义
| 层 | 定义 | 学习频率 | 成本 |
|---|---|---|---|
| Model | 底层模型权重(SFT/RL/LoRA) | 低频 | 高,平台级 |
| Harness | 驱动模型运行的外壳(系统提示、工具暴露、调用循环、截断策略) | 中频 | 工程驱动,可评测 |
| Context | harness 外部可配置上下文(memory files、skills、用户偏好、团队规则) | 高频 | 低,业务驱动 |
实例映射
| 系统 | Model | Harness | Context |
|---|---|---|---|
| Claude Code | Claude Sonnet 等 | Claude Code 本身 | CLAUDE.md、/skills、mcp.json |
| openclaw | 多模型 | Pi + 运行脚手架 | SOUL.md + ClawHub skills |
Harness 层:Meta-Harness 模式
让 agent 帮你改 agent 的自动优化循环:
- 在标准任务集上运行 agent,收集执行日志与得分
- 把历史候选、源代码、完整 traces 保存在文件系统
- 让 coding agent 阅读这些材料,提出 harness 改动候选
- 评测新 harness,继续迭代
关键差异:让优化器看到完整历史代码 + 分数 + 执行 trace,而不是只看摘要。
参考:Meta-Harness
Context 层:分层记忆系统
Context 不是”多塞一点提示词”,而是可持久化、可分层、可读写、可检索的记忆系统:
agent-scoped memory:所有用户共享同一份 agent 记忆user-scoped memory:每个用户拥有独立记忆- 在线更新:会话中直接写入
- 后台整理:会话外做 consolidation
skills作为程序性记忆,按需加载
Traces 是统一燃料
没有高质量 traces,就没有高质量 agent learning loop:
- 改 Model → traces 作为训练/偏好数据来源
- 改 Harness → traces 作为失败诊断材料
- 改 Context → traces 作为经验提取素材
落地优先级
- 先把 traces 做对:统一记录任务输入、工具调用、关键中间状态、输出结果、人工反馈
- 优先做 Context learning:用户偏好、团队规则、术语表、操作 SOP
- 建立 Harness optimization loop:A/B 评测 + coding agent 辅助改动 + 回滚机制
- 最后才考虑 Model-level learning:积累足够 traces 且 harness/context 优化逼近上限后
判断框架(四问)
遇到”agent 该怎么学”时先问:
- 要改的是模型能力、运行机制,还是可配置记忆?
- 改动应作用在
agent、user还是org作用域? - 更新应在运行中即时发生,还是离线整理后再生效?
- 有没有足够完整的 traces 支持评估学习效果?
范式转移的三个维度
1. 学习目标:从权重转向系统行为
传统 LLM 持续学习关注 loss/benchmark,agent 持续学习关注:
- 是否更会使用工具、规划步骤
- 是否更能从过去失败里改进执行策略
- 是否更了解当前用户/团队/组织的偏好
2. 学习单位:从单模型转向分层架构
同一 agent 系统里,不同层的学习频率与代价完全不同(见三层定义表)。持续学习不该只有一个总开关,而应该是三套不同机制。
3. Traces 成为统一燃料
- 改 Model → traces 作为训练/偏好数据来源
- 改 Harness → traces 作为失败诊断材料
- 改 Context → traces 作为经验提取素材
2026 年竞争格局判断
如果 2024 年大家主要比拼”谁先把 agent 跑起来”,那么 2026 年更像是在比:
- 谁的 harness 更稳
- 谁的 traces 更完整
- 谁的评测与回放体系更闭环
- 谁能更快把失败案例沉淀为下一版 agent 行为改进
Context 层会最先大规模落地(不需要训练 infra、对业务回报最直接、易于权限管理和回滚)。Harness 层是下一轮 agent 基建竞争焦点。
相关
- openclaw — OpenClaw 的 SOUL.md + ClawHub 是 Context 层的典型实现
- darwin-skill — Skill 自动进化系统,属于 Harness/Context 层优化的工程实践
- openclaw-sessions-tools — 多 Agent 编排,与 Harness 层设计密切相关
- 2604.14228_dive-into-claude-code — Claude Code 架构分析,印证三层框架的 Claude Code 映射
- meta-harness — Harness 自动优化框架,文件系统级 traces 诊断