Skill 自动进化系统 —— 评估、改进、测试、只保留有改进的修改。受 Karpathy autoresearch 启发。
为什么值得关注
Agent Skill 生态在快速扩张(Claude Code、Codex、OpenClaw 等),当 Skill 数量超过手动维护能力时,需要系统化的质量管理。传统审查只检查结构格式,达尔文.skill 同时评估结构质量和实际效果,用棘轮机制确保只保留改进。
核心特性
- 双重评估:静态结构分析(60分)+ 实际运行效果(40分),总分100
- 棘轮机制:分数只升不降,退步自动 git revert,不积累局部退化
- 独立评分:子 agent 独立评分,避免「自己改自己评」的偏差
- 人在回路:每个 Skill 优化完后暂停,展示 diff + 分数变化,等用户确认
- 8 维评估体系:覆盖结构完整度、触发精准度、步骤可执行性、实测表现等
技术栈
- 基于 SKILL.md 格式(Claude Code / Codex / OpenClaw 等通用)
- HTML(标签/文档层)
- Git 作为版本管理和回滚机制
- 子 agent 架构实现独立评分
适用场景
- 管理大量 Skill(10+)需要系统化质量保障时
- 想持续优化现有 Skill 但不确定改动是否有效时
- 团队协作中需要 Skill 质量不随时间退化时
局限性
- 仅支持 SKILL.md 格式的 Skill 优化
- 评估依赖子 agent 能力,评分标准可能有波动
- 新项目(2026-04 创建),生态和社区尚在早期
生态系统
- 直接灵感来源:Karpathy 的 autoresearch
- 目标平台:Claude Code、Codex、OpenClaw、Trae、CodeBuddy
- 作者相关:花叔 (bookai.top, huasheng.ai)
项目数据
| 指标 | 值 |
|---|---|
| Stars | 1,293 |
| Forks | 152 |
| License | MIT |
| 创建时间 | 2026-04-13 |
| 语言 | HTML |
个人评价
思路清晰,把 autoresearch 的「只保留可测量改进」理念迁移到 Skill 质量管理,解决了 Skill 生态扩张后的维护痛点。8 维评估体系和棘轮机制设计合理。作为新项目增长迅速(一周 1.2k star),值得关注后续发展。