一句话定位:2026 年 3 月以 Karpathy autoresearch 为起点爆发的「AI 自主做科研」开源工具链,8 款代表项目覆盖从极简实验循环到端到端论文生成的全谱系。
五大技术流派
| 流派 | 代表项目 | 核心哲学 |
|---|
| 极简单任务派 | Karpathy autoresearch | AI 收敛到最机械的实验迭代,人类把控方向 |
| 泛化迭代派 | uditgoenka autoresearch | Karpathy Loop 泛化到任何可量化任务 |
| 全流程端到端派 | AutoResearchClaw, The AI Scientist | AI 是完整「虚拟研究员」,人仅提供 idea |
| 进化记忆派 | EvoScientist | 双记忆库解决「无法积累经验」的核心瓶颈 |
| 工具链赋能派 | ARIS, Dr. Claw, Orchestra | AI 做「科研副驾驶」,可插拔按需组合 |
项目速览
Karpathy autoresearch
- GitHub: karpathy/autoresearch,~630 行 Python,MIT
- 三文件架构:
prepare.py(不可变评估)、train.py(Agent 沙盒)、program.md(自然语言指令)
- 指标:
val_bpb(validation bits per byte),词表无关
- 循环:读源码 → 改 train.py → 训练 5 min → 评估 → 保留/回滚,~12 exp/h,一夜 ~100 exp
- 实绩:2 天 700 实验,Time-to-GPT-2 从 2.02h → 1.80h(↓11%)
- 短板:场景极度单一(仅 LLM 训练),无文献/论文能力
uditgoenka autoresearch
- GitHub: uditgoenka/autoresearch,⭐ 2.3k,MIT,Claude Code 插件
- 8 条铁律:原子修改、机械验证、自动回滚、Git-as-memory 等
- 9 命令集:
/autoresearch、/autoresearch:security、/autoresearch:debug、/autoresearch:predict(5 角色辩论)等
- Guard 回归防护 + Crash Recovery 机制
- 与 Karpathy 区别:场景从 ML 训练扩展到任意可量化任务
AutoResearchClaw
- GitHub: aiming-lab/AutoResearchClaw
- 8 相位 23 阶段流水线:研究定义 → 文献检索 → 知识综合 → 假设生成(辩论)→ 实验设计执行 → 分析决策 → 论文撰写 → 引用验证
- 多视角辩论 + 4 层引用校验(anti-fabrication guard)
- 输出 NeurIPS/ICML 模板 LaTeX 论文
- 短板:算力要求较高(8G+ 显存),创新深度依赖基座模型
EvoScientist
- arXiv 2603.08127(2026-03-09)
- 三 Agent:RA(idea 生成)+ EA(实验执行)+ EMA(经验蒸馏)
- 双记忆模块:Ideation Memory(高质量/失败方向)+ Experimentation Memory(有效策略/最佳代码)
- 评估:6 篇论文投 ICAIS 2025,6 投 6 中,超 7 个 SOTA
- 短板:架构复杂,算力存储要求高
ARIS(Auto-Research-In-Sleep)
- GitHub: wanshuiyin/Auto-claude-code-research-in-sleep
- 每个 skill 就是一个 SKILL.md,任何 LLM agent 可读取执行
- executor + reviewer 对抗式协作,克服单模型盲区
- 兼容 Claude Code / Codex CLI / Cursor / Trae / Windsurf
- 短板:无自主实验执行能力
The AI Scientist(Sakana AI)
- GitHub: SakanaAI/AI-Scientist-v2
- 里程碑:v2 生成的论文通过 ICLR 2025 workshop 同行评审,平均分 6.33,超过 55% 人类论文(团队主动撤稿)
- Nature 发表:首个通过顶会同行评审的 AI 科研系统
- 短板:部署极高(GPU 集群 + 64G 内存),算力成本极高
全流程能力评分(10 分制)
| 项目 | 文献调研 | 假设生成 | 实验执行 | 结果分析 | 论文撰写 | 同行评审 |
|---|
| autoresearch | 0 | 3 | 10 | 8 | 0 | 0 |
| AutoResearchClaw | 9 | 8 | 8 | 8 | 9 | 8 |
| EvoScientist | 9 | 10 | 9 | 9 | 8 | 9 |
| ARIS | 7 | 5 | 4 | 6 | 8 | 9 |
| The AI Scientist | 10 | 10 | 9 | 10 | 10 | 10 |
| uditgoenka autoresearch | 0 | 5 | 8 | 7 | 0 | 0 |
选型建议
- 有 GPU 做 ML 调参 → Karpathy autoresearch
- 快速出论文初稿 → AutoResearchClaw
- 长期深耕单领域 → EvoScientist
- 给现有 agent 加科研技能 → ARIS
- 无代码基础 / 多项目管理 → Dr. Claw
- 任意可量化任务自主优化 → uditgoenka autoresearch
- 顶级机构高严谨性研究 → The AI Scientist
组合使用
- autoresearch(跑实验)+ ARIS(文献综述)+ Research-Claw(日常管理)
- uditgoenka autoresearch(代码迭代)+ ARIS(科研特定能力)互补短板
Open Problems
- 实验可复现性:多 GPU / 长训练场景如何公平比较?
- 学术诚信:AI 生成论文的伦理规范仍需社区共识
- 记忆污染:错误经验如何清洗?遗忘机制需更好设计
- 互操作标准:各家 skill 格式仍不统一(Markdown-as-Protocol 方向正确但未收敛)
- Agent 锁定风险:强绑定特定 agent 的可移植性问题
相关