@sitinme: 看到 Karpathy 开源了一个很有意思的项目autoresearch,把一个真实但小型的 LLM 训练任务交给 AI Agent,让它自己做研究、改代码、跑实验、看结果,然后决定保留还是放弃这次改动。 这个项目基于单张 NVIDIA …

X AI KOLs Timeline 工具

摘要

Karpathy 开源了一个实验性项目 autoresearch,让 AI Agent 自动完成小规模 LLM 训练的研究循环:修改代码、运行实验、评估结果并迭代优化,人类只需编写研究计划和约束。

看到 Karpathy 开源了一个很有意思的项目autoresearch,把一个真实但小型的 LLM 训练任务交给 AI Agent,让它自己做研究、改代码、跑实验、看结果,然后决定保留还是放弃这次改动。 这个项目基于单张 NVIDIA GPU 上的 nanochat 训练流程。Agent 每次会修改训练代码,运行大约 5 分钟,看验证指标有没有变好。 如果变好了就保留,不好就丢掉,然后继续下一轮。也就是说,你晚上把任务交给 Agent,第二天醒来就能看到一串自动实验记录,以及可能被优化过的模型。 这个项目刻意设计得很小,主要就几个文件:http://prepare.py 负责数据准备和工具函数,http://train.py 是 Agent 真正会修改的训练代码,program.md 则相当于给 Agent 的研究指令。 人类更多是在写“研究计划”和约束,而不是像以前一样手动一点点改模型结构、超参数和训练逻辑。 它展示了一种新的 AI 研究方式:不是让 AI 只帮你写代码,而是让 AI 参与完整的实验循环。 它会提出改动、执行实验、评估结果,并持续迭代。这有点像把一个初级研究员放进一个受控环境里,让它不断试错。 目前 autoresearch 还是一个偏实验性质的项目,默认更适合单张 NVIDIA GPU,尤其是高性能卡,比如 H100。如果是 Mac、Windows 或 AMD 平台,也已经有人做了一些 fork 版本。
查看原文
查看缓存全文

缓存时间: 2026/05/21 21:39

看到 Karpathy 开源了一个很有意思的项目autoresearch,把一个真实但小型的 LLM 训练任务交给 AI Agent,让它自己做研究、改代码、跑实验、看结果,然后决定保留还是放弃这次改动。

这个项目基于单张 NVIDIA GPU 上的 nanochat 训练流程。Agent 每次会修改训练代码,运行大约 5 分钟,看验证指标有没有变好。

如果变好了就保留,不好就丢掉,然后继续下一轮。也就是说,你晚上把任务交给 Agent,第二天醒来就能看到一串自动实验记录,以及可能被优化过的模型。

这个项目刻意设计得很小,主要就几个文件:http://prepare.py 负责数据准备和工具函数,http://train.py 是 Agent 真正会修改的训练代码,program.md 则相当于给 Agent 的研究指令。

人类更多是在写“研究计划”和约束,而不是像以前一样手动一点点改模型结构、超参数和训练逻辑。

它展示了一种新的 AI 研究方式:不是让 AI 只帮你写代码,而是让 AI 参与完整的实验循环。

它会提出改动、执行实验、评估结果,并持续迭代。这有点像把一个初级研究员放进一个受控环境里,让它不断试错。

目前 autoresearch 还是一个偏实验性质的项目,默认更适合单张 NVIDIA GPU,尤其是高性能卡,比如 H100。如果是 Mac、Windows 或 AMD 平台,也已经有人做了一些 fork 版本。

相似文章

@WWTLitee: 有没有什么办法让AI自主迭代优化? 有,来看看这个 autoresearch 它的核心不是让 AI 直接“发明论文”,而是把研究过程拆成一个可验证循环:人类写 program.md 给研究方向,AI agent 修改 http://tra…

X AI KOLs Timeline

介绍了autoresearch项目,它将AI研究过程拆解为可验证的循环(固定环境、单一可编辑文件、固定指标、Git回滚),使AI agent能进行可控、可复现的实验迭代;同时提及了12-factor-agents清单。