新研究测试多款LLM与数千真实用户,发现AI无法模拟人类偏好

Reddit r/ArtificialInteligence 论文

摘要

一项新研究在28项真实世界研究中测试了LLM,发现它们仅在53%的情况下与人类多数一致,与随机猜测无异,挑战了用LLM取代人类反馈的趋势。

https://arxiv.org/abs/2605.18311 如今,各大公司正掀起一股用LLM驱动的“模拟用户”取代真实人类反馈的热潮。这个想法在纸面上听起来很美好——既然只需输入提示就能完成,何必花时间和金钱招募真人来测试产品、选择设计方案或评估选项呢?研究人员在涵盖78个选择任务的28项真实世界研究中测试了LLM,观察它们的选择是否与数千名真实人类参与者一致。结果如何?LLM仅在53%的情况下与人类多数选择一致。由于大多数任务是在两个选项之间选择,这几乎和抛硬币无异。更糟糕的是,对于“模拟”论点而言:添加详细的角色描述和思维链推理几乎没有任何改进。实际上,它反而使得LLM的推理与真实人类理由的语义相似度更低,因为模型的“推理”只是使输出同质化,未能捕捉到真实的生活经历。看起来,LLM的训练只是复制我们喜欢它们的输出,而不是让它们能够预测人类偏好。是时候承认,在复制人类选择方面,LLM模拟已经遇到了硬天花板?
查看原文

相似文章

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。

AI在招聘时比人类更容易形成偏见

MIT Technology Review

新研究显示,大型语言模型能够从经验中形成自身偏见,并且比人类更倾向于对求职者进行刻板印象评估,这引发了对AI用于招聘的担忧。

使用LLMs

Reddit r/singularity

这篇文章反思了身边的人对LLMs如ChatGPT的有限使用和理解,引发了关于AI工具广泛采用的疑问。