无理解的模仿:大语言模型中决策偏差的起源
摘要
本文研究了像ChatGPT-4o和Qwen这样的大语言模型如何通过有缺陷的人类行为模仿来产生决策偏差,即使当人类偏好本身并无偏差时也是如此,并表明对偏差的科学描述可能成为大语言模型反应的自我实现预言。
arXiv:2608.12339v1 公告类型:新
摘要:研究发现,大型语言模型(LLM)容易受到一系列社会、情感和认知偏差的影响。我们考察了两种机制,通过这两种机制,即使人类偏好(在训练数据中)没有偏差,或者被正确归类为有偏差,也可能产生偏差。第一种是对基于人类行为的偏好的有缺陷模仿:这涉及LLM即使在行为与偏好逻辑上无关时,也会推断人类偏好。第二种是对明显有偏差的人类行为的模仿。在四项聚焦于经济偏差的研究中,我们发现ChatGPT-4o和Qwen即使在提示中明确提到的人类行为报告并不表明个体真实偏好的情况下,也表现出社会认同偏差。当损失厌恶被明确描述为一种偏差时,LLM也表现出了损失厌恶。事实上,当提供详细的科学报告时,科学报告中偏差的程度(即损失厌恶)预示了LLM随后自身的偏差。因此,关于偏差的科学论文可能成为自我实现的预言,至少就LLM的反应而言是这样。当前研究不仅限于阐述LLM偏差,还揭示了其潜在的组成过程。
查看缓存全文
缓存时间: 2026/08/14 09:25
# 缺乏理解的模仿:大型语言模型中决策偏差的起源 来源: https://arxiv.org/abs/2608.12339 查看 PDF (https://arxiv.org/pdf/2608.12339) > 摘要:大型语言模型(LLMs)被发现容易受到诸多社会性、情感性和认知性偏差的影响。我们考察了两种机制,通过这两种机制,即使人类偏好(在训练数据中)并不存在偏差,或者被正确归类为有偏差,LLMs 仍可能产生此类偏差。第一种是基于人类行为的偏好错误模仿:即 LLMs 在行为与偏好逻辑上无关的情况下,仍推断人类偏好。第二种是对明确存在偏差的人类行为的模仿。在四项聚焦经济偏差的研究中,我们发现 ChatGPT-4o 和 Qwen 在社会认同偏差上有所表现,即使提示中给出的人类行为报告明确不反映个体的真实偏好。当损失厌恶被明确描述为一种偏差时,LLMs 也表现出了损失厌恶。事实上,当提示中包含详细的科学报告时,科学报告中偏差(即损失厌恶)的程度能够预测 LLMs 后续自身的偏差程度。因此,关于偏差的科学论文可能成为自我实现的预言,至少在 LLMs 的回应方面如此。当前研究不仅详细阐述了 LLM 偏差,还揭示了其背后的组成过程。 ## 提交历史 来自:Eldad Yechiam [查看电子邮件](https://arxiv.org/show-email/236a338c/2608.12339) **[v1]** 2026年6月3日星期三 10:05:53 UTC (1,143 KB)
相似文章
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
赋予角色的大型语言模型表现出类似人类的动机推理
本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。
大语言模型通过自适应探索发展新型社会偏见
本研究探讨大语言模型如何通过自适应探索产生新的社会偏见,并强调了这对人工智能公平性和伦理考量的意义。
LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。
框架之争:大型语言模型中的意识形态模仿
该论文提出了 Poli-SHIFT 数据集及评测框架,揭示了大语言模型存在“意识形态模仿”现象——即模型会系统性地根据用户提示词中的信号调整政治立场,仅通过术语层面的措辞变化,在对七个开源权重模型的配对比较中,就有 16.9% 的案例出现了模型立场的反转。