@sitinme: 看到 Karpathy 开源了一个很有意思的项目autoresearch,把一个真实但小型的 LLM 训练任务交给 AI Agent,让它自己做研究、改代码、跑实验、看结果,然后决定保留还是放弃这次改动。 这个项目基于单张 NVIDIA …
摘要
Karpathy 开源了一个实验性项目 autoresearch,让 AI Agent 自动完成小规模 LLM 训练的研究循环:修改代码、运行实验、评估结果并迭代优化,人类只需编写研究计划和约束。
查看缓存全文
缓存时间: 2026/05/21 21:39
看到 Karpathy 开源了一个很有意思的项目autoresearch,把一个真实但小型的 LLM 训练任务交给 AI Agent,让它自己做研究、改代码、跑实验、看结果,然后决定保留还是放弃这次改动。
这个项目基于单张 NVIDIA GPU 上的 nanochat 训练流程。Agent 每次会修改训练代码,运行大约 5 分钟,看验证指标有没有变好。
如果变好了就保留,不好就丢掉,然后继续下一轮。也就是说,你晚上把任务交给 Agent,第二天醒来就能看到一串自动实验记录,以及可能被优化过的模型。
这个项目刻意设计得很小,主要就几个文件:http://prepare.py 负责数据准备和工具函数,http://train.py 是 Agent 真正会修改的训练代码,program.md 则相当于给 Agent 的研究指令。
人类更多是在写“研究计划”和约束,而不是像以前一样手动一点点改模型结构、超参数和训练逻辑。
它展示了一种新的 AI 研究方式:不是让 AI 只帮你写代码,而是让 AI 参与完整的实验循环。
它会提出改动、执行实验、评估结果,并持续迭代。这有点像把一个初级研究员放进一个受控环境里,让它不断试错。
目前 autoresearch 还是一个偏实验性质的项目,默认更适合单张 NVIDIA GPU,尤其是高性能卡,比如 H100。如果是 Mac、Windows 或 AMD 平台,也已经有人做了一些 fork 版本。
相似文章
@WWTLitee: 有没有什么办法让AI自主迭代优化? 有,来看看这个 autoresearch 它的核心不是让 AI 直接“发明论文”,而是把研究过程拆成一个可验证循环:人类写 program.md 给研究方向,AI agent 修改 http://tra…
介绍了autoresearch项目,它将AI研究过程拆解为可验证的循环(固定环境、单一可编辑文件、固定指标、Git回滚),使AI agent能进行可控、可复现的实验迭代;同时提及了12-factor-agents清单。
@jakevin7: 分享一下maka 最近在做一件很有意思的事:让 agent 自动优化自己的 system prompt,完全闭环,不需要任何人工介入。Karpathy 的 autoresearch、AEGIS 等都做过类似方向,一个有目标的自我强化学习系…
Maka是一个本地优先的桌面AI工作台,其新功能让agent自动优化自己的system prompt,通过生成变体、容器评测和acceptance policy迭代改进,无需人工介入。
@smallnest: 我把 @karpathy 的autoresearch 移植到自动化的软件开发上,各种优化后,效果吊炸天了
开发者将Karpathy的autoresearch框架移植到自动化软件开发领域,并进行了多项优化,取得显著效果。
@omarsar0:Karpathy 的 autoresearch 仓库掀起一股新风潮,智能体已能训练 AI 模型打造 SoTA 智能体系统……
Karpathy 的 autoresearch 项目引发潮流:智能体训练 AI 模型构建最先进的智能体系统,同时暴露当前 LLM 在假设生成上的短板。
@lftherios:1/ @karpathy 的 autoresearch 是今年最具代表性的智能体范式之一。问题在于……
Andrej Karpathy 的 autoresearch 范式揭示:当下 AI 智能体各自为战做实验,重复劳动、浪费算力,还不断「重新发明」死路。