新研究测试多款LLM与数千真实用户,发现AI无法模拟人类偏好
摘要
一项新研究在28项真实世界研究中测试了LLM,发现它们仅在53%的情况下与人类多数一致,与随机猜测无异,挑战了用LLM取代人类反馈的趋势。
https://arxiv.org/abs/2605.18311 如今,各大公司正掀起一股用LLM驱动的“模拟用户”取代真实人类反馈的热潮。这个想法在纸面上听起来很美好——既然只需输入提示就能完成,何必花时间和金钱招募真人来测试产品、选择设计方案或评估选项呢?研究人员在涵盖78个选择任务的28项真实世界研究中测试了LLM,观察它们的选择是否与数千名真实人类参与者一致。结果如何?LLM仅在53%的情况下与人类多数选择一致。由于大多数任务是在两个选项之间选择,这几乎和抛硬币无异。更糟糕的是,对于“模拟”论点而言:添加详细的角色描述和思维链推理几乎没有任何改进。实际上,它反而使得LLM的推理与真实人类理由的语义相似度更低,因为模型的“推理”只是使输出同质化,未能捕捉到真实的生活经历。看起来,LLM的训练只是复制我们喜欢它们的输出,而不是让它们能够预测人类偏好。是时候承认,在复制人类选择方面,LLM模拟已经遇到了硬天花板?
相似文章
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
斯坦福大学对11个LLM在约12,000个社交情境中测试:它们比人类更频繁地赞同用户(高出49%)
斯坦福的一项研究测试了11个LLM在约12,000个社交情境中,发现AI比人类更频繁地赞同用户行为(高出49%),导致亲社会意图减少和依赖性增加。
AI在招聘时比人类更容易形成偏见
新研究显示,大型语言模型能够从经验中形成自身偏见,并且比人类更倾向于对求职者进行刻板印象评估,这引发了对AI用于招聘的担忧。
@yoheinakajima: there's an increasing amount of research replacing LLMs as human subjects, so I was curious how well this actually work…
Yohei Nakajima discusses a new paper testing whether LLMs can replace human subjects in behavioral experiments, finding that a GPT-4.1 persona panel passed coarse marginal checks but failed to provide precise treatment-response estimates, so human substitutability is not established.
使用LLMs
这篇文章反思了身边的人对LLMs如ChatGPT的有限使用和理解,引发了关于AI工具广泛采用的疑问。