一句话定位:给 AI agent 一个真实的 LLM 训练环境,让它夜间自主改代码、跑实验、看指标,人类早上醒来看结果。
GitHub: https://github.com/karpathy/autoresearch Stars: 74,560 | Language: Python | License: MIT
为什么值得关注
- Karpathy 本人项目,2026 年 3 月发布,引爆「AI 自主做科研」赛道
- 极简设计(~630 行),却展示了 AI 自主实验迭代的完整范式
- 实绩:2 天 700 实验,Time-to-GPT-2 从 2.02h → 1.80h(↓11%);Shopify CEO 一夜 37 实验 ↓19%
核心特性
- 三文件架构:
prepare.py(不可变评估)、train.py(Agent 沙盒)、program.md(自然语言指令) - 固定 5 分钟时间预算:每次实验 wall clock 5 分钟,~12 exp/h,一夜 ~100 exp
- 单一指标:
val_bpb(validation bits per byte),词表无关,公平比较不同架构 - 棘轮机制:改进则保留 commit,退步则
git reset,只进不退 - 评估与实验完全隔离:
prepare.py不可改,杜绝 AI 作弊
实验循环
Human ──→ program.md (自然语言指令)
│
▼
AI Agent (Claude / Codex)
│
读 + 改 train.py → git commit
│
▼
GPU 训练 5 min → eval val_bpb
│
┌────┴────┐
improve? no → git reset
│
keep → results.tsv → 下一轮
技术栈
- Python 3.10+,uv 包管理
- 单 NVIDIA GPU(测试于 H100)
- 基于 nanochat(简化版单 GPU LLM 训练)
- 无分布式训练,无复杂配置
适用场景
- 有 GPU 的 ML 研究者,想自动化超参/架构搜索
- 夜间无人值守的实验迭代
- 验证「AI 自主做科研」范式的起点
局限性
- 场景极度单一:仅 LLM 训练(nanochat)
- 无文献调研、论文撰写能力
- 无多 Agent 协作
- 需要 NVIDIA GPU(社区有 MacOS/AMD/Windows fork)
- 强依赖 Claude/Codex API
生态系统
- autoresearch-ecosystem — 8 款 AutoResearch 项目全景对比
- llm-wiki-pattern — Karpathy 同期提出的 LLM 知识库构建方法论
个人评价
设计哲学极度克制:只做一件事(ML 实验迭代),把它做到极简。prepare.py 不可改这个设计尤其聪明——既防止 AI 作弊,又强制人类明确定义「什么是成功」。program.md 作为人机接口的设计也值得借鉴:人类用自然语言定义研究方向,AI 负责机械执行。