标签
本文评估了大型语言模型(ChatGPT、Claude、DeepSeek)在物理、天体物理和宇宙学领域生成单页项目计划的能力,以及人类和AI评审员如何对其进行评估。结果表明,人类评审员对AI和人类撰写的提案评分相似,而AI评审员则更偏好AI撰写的提案,并能完美区分两者。
这篇来自耶鲁大学和芝加哥大学的论文发现,LLM生成的研究思路与人类研究思路的主要区别不在于质量,而在于范围:LLM产生的思路更窄,其中47%-64%的思路侧重于连接不同的工作,而人类的这一比例仅为12.1%。
SoundnessBench是一个包含1,099个机器学习研究提案的基准测试,用于评估大语言模型评判方法论有效性的能力,结果发现当前模型普遍存在乐观偏差。