标签
耶鲁大学的论文通过构建大规模评估框架,比较了LLM与人类研究者在生成研究想法上的分布差距,发现LLM想法高度集中于bridge和synthesis类型,而人类想法分布更广,揭示了'研究品味'的差异,对Research Agent的多样性提出挑战。
本文研究了基于执行的自动化AI研究,通过构建一个自动执行器来实现LLM生成的想法并运行实验。结果表明,执行引导的进化搜索可以找到在预训练和后训练任务中显著优于基线的方法。