标签
耶鲁大学的论文通过构建大规模评估框架,比较了LLM与人类研究者在生成研究想法上的分布差距,发现LLM想法高度集中于bridge和synthesis类型,而人类想法分布更广,揭示了'研究品味'的差异,对Research Agent的多样性提出挑战。
本研究论文引入了一个框架,用于衡量人类生成与LLM生成的研究思路之间的分布差距,发现LLM思路集中在特定的机会模式与综合方法上,而人类思路则更为多样化。
OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。