标签
本文评估了大型语言模型(ChatGPT、Claude、DeepSeek)在物理、天体物理和宇宙学领域生成单页项目计划的能力,以及人类和AI评审员如何对其进行评估。结果表明,人类评审员对AI和人类撰写的提案评分相似,而AI评审员则更偏好AI撰写的提案,并能完美区分两者。