大语言模型中的评论赞誉取向:来自电影偏好诱导的证据
摘要
本文考察大语言模型在电影偏好中是否再现了评论界赞誉与商业成功的层级结构,通过对20,000次成对比较的发现,模型一致偏好获得评论界赞誉但商业上小众的电影,且这种取向随模型规模增大而增强。
arXiv:2608.06955v1 公告类型:新
摘要:大语言模型(LLM)的训练语料包含人类对电影、书籍、音乐等事物的判断表达。然而,LLM是否系统性地再现了评价性层级结构仍不清楚。以往关于LLM文化偏见的研究提出了相互竞争的预期:模型可能镜像互联网文本中的流行度信号,也可能再现嵌入在评论话语中的声望形式。我们通过对四个模型家族(Anthropic、OpenAI、Alibaba和Mistral)的八个模型进行电影评估研究来探讨这一问题,使用一个包含200部电影的基准数据集,将其划分为评论界赞誉型、商业成功型以及双重合法性(评论界赞誉+商业成功)型。通过对每个模型20,000次成对强制选择比较进行Bradley-Terry估计分析,我们观察到所有模型一致表现出评论赞誉取向:评论界赞誉但商业上小众的电影被优先选择,而非商业成功但未获评论认可的电影。这一模式在每个模型家族内部随模型规模增大而增强。此外,嵌套OLS回归分析表明,评价取向、公众可见度和大众接受度各自对解释偏好有显著作用。在控制公众可见度后,模型对双重合法性电影的偏好超过仅评论赞誉电影的现象发生逆转;而进一步考虑大众接受度后,仅商业成功电影的大部分劣势被削弱。最后,评价型与推荐型提示框架产生不同的排序,表明评论赞誉取向可能间接体现在现实世界的LLM部署中。
查看缓存全文
缓存时间: 2026/08/10 08:00
# 大型语言模型中的评论界赞誉取向:来自电影偏好诱导的证据 来源:https://arxiv.org/html/2608.06955 ###### 摘要 大型语言模型(LLMs)在包含人类对电影、书籍、音乐等判断表达的训练语料上进行训练。然而,LLMs 是否系统地再现评价性等级仍不清楚。先前关于 LLM 文化偏见的研究提出了相互竞争的预期:模型可能反映互联网文本的流行度信号,也可能再现嵌入在评论界话语中的声望形式。我们通过对来自四个模型家族(Anthropic、OpenAI、Alibaba 和 Mistral)的八个模型进行电影评估研究来探讨这个问题,使用一个包含 200 部电影、分为评论界赞誉、商业成功和双重合法性(评论界赞誉 + 商业成功)三类的基准。通过对每个模型 20,000 次成对强制选择比较进行 Bradley–Terry 估计,我们观察到所有模型一致呈现评论界赞誉取向:评论界赞誉但商业上鲜为人知的电影会被选择为优于商业成功但未获评论界认可的电影。这一模式在每个家族内部随模型规模增大而增强。此外,嵌套 OLS 回归分析表明,评价取向、公众可见度和大众接受度截然不同地有助于解释偏好。调整公众可见度后,模型对双重合法性电影的偏好超过仅评论界赞誉电影的偏好会被逆转;而进一步考虑大众接受度后,仅商业成功的电影的大部分劣势会被削弱。最后,评价性和推荐导向的提示框架会产生不同的排名,表明评论界赞誉取向可能在现实世界的 LLM 部署中间接显现。代码与数据—https://github.com/jonghyunjee/llm-film-preference 补充材料—https://doi.org/10.5281/zenodo.20826032 ## 引言 正如 Weatherby(2025 (https://arxiv.org/html/2608.06955#bib.bib48))所论证的,大型语言模型是计算-文化接口,它们大规模地摄入了人类文化,并学会了在其结构内运作。但训练语料在评价上并非中立。它们包含数十年的电影评论、经典片单和文化话语,反映了评论界经典化与商业成功之间长期存在的区分。我们研究 LLMs 是否在其输出中再现这些区分,以及通过何种机制。 两条相互竞争的预测构建了我们的研究。一种来自可见性。商业成功的电影通常在在线话语量上占主导地位。粉丝社区、新闻报道和社交媒体讨论往往更多地以当代大片为特色,而不是,比如说,20世纪60年代的艺术影院电影。如果 LLM 输出主要反映训练相关语料中的曝光模式,模型将偏好广泛可见的文化对象。另一种预期来自文化声望。评论界话语往往反映文化精英的整合判断和偏好,也合理地存在于模型的训练数据中。如果评价性区分以超越公众可见性差异的方式嵌入语言中,模型将再现与评论界赞誉相关的声望形式,即使这些对象获得的公众关注较少。 先前的研究已经描述了模型如何沿人口统计学(Duan et al. 2025 (https://arxiv.org/html/2608.06955#bib.bib19); Salinas et al. 2025 (https://arxiv.org/html/2608.06955#bib.bib41); Seth et al. 2025 (https://arxiv.org/html/2608.06955#bib.bib43))、国家与语言(Naous et al. 2024 (https://arxiv.org/html/2608.06955#bib.bib33); Poole-Dayan et al. 2024 (https://arxiv.org/html/2608.06955#bib.bib37))以及政治维度(Motoki et al. 2023 (https://arxiv.org/html/2608.06955#bib.bib32); Waight et al. 2026 (https://arxiv.org/html/2608.06955#bib.bib46))编码社会偏见和不对称。文化偏好——即倾向于某些文化对象而非其他——属于一个独特的分析范畴。它不显而易见地是一种偏见,这也可能是它一直处于标准公平性审计范围之外的原因。然而,文化社会学家早已确立,偏好不仅仅是个人特质:它沿着声望和合法性的轴线结构化,这些轴线映射到社会等级(DiMaggio and Useem 1978 (https://arxiv.org/html/2608.06955#bib.bib18); Bourdieu 1984 (https://arxiv.org/html/2608.06955#bib.bib12); Bryson 1996 (https://arxiv.org/html/2608.06955#bib.bib15); Peterson and Kern 1996 (https://arxiv.org/html/2608.06955#bib.bib36))。这些等级已经潜在于语言的分布结构中:在大规模语料上训练的词嵌入能够恢复与布迪厄的“区分”概念一致的文化维度(Kozlowski et al. 2019 (https://arxiv.org/html/2608.06955#bib.bib26))。当模型被直接问及它们偏好哪些文化对象时,这些等级是否会在 LLM 的评价性输出中浮现,正是本研究试图理解的。 我们通过对来自四个家族(Anthropic、OpenAI、Alibaba、Mistral)的八个模型进行电影成对比较研究来调查这个问题。使用一个跨越评论界赞誉、商业成功和共同认可电影的 200 部电影基准,我们每个模型引出 20,000 次比较,以估计每部电影的潜在比较强度。在所有八个模型中,我们发现一种一致的模式,我们称之为评论界赞誉取向:LLM 输出偏好评论界赞誉的文化对象,而不是商业成功但未获评论界认可的对象。在每个家族内部,这种效应随模型规模增大而增强。为了调查这种评价取向的来源,我们区分了数据中的几个不同信号。首先,我们将在线话语的数量(volume)与其评价效价(evaluative valence)分离。数量,我们操作化为公众可见度,指的是围绕某个文化对象的话语量。效价决定了附着在该对象上的规范性判断,我们进一步将其分为两种合法化模式:评论界赞誉(文化机构的经典化认可)和大众接受度(大众受众的吸引力)。通过拟合一系列嵌套回归模型,纳入公众可见度(IMDb 投票数)和大众接受度(IMDb 用户评分)的代理变量,我们评估在考虑这些竞争信号后,观察到的评价模式是否仍然存在。结果表明,LLMs 表现出与公众可见度或大众接受度相关但截然不同的评论界赞誉取向。这些发现扩展了先前关于 LLM 文化偏见的工作,并为 LLM 输出的一个新颖不对称维度提供了证据。无论算法系统是否具有内部认知状态或“品味”,其行为输出都倾向于获得评论界经典化认可的作品。 ## 相关工作 ### LLM 中的评价取向 关于 LLM 输出的研究揭示了种族、性别和社会经济维度上的系统性模式(Arzaghi et al. 2024 (https://arxiv.org/html/2608.06955#bib.bib6); Bommasani and Liang 2024 (https://arxiv.org/html/2608.06955#bib.bib11); Nicolas and Caliskan 2025 (https://arxiv.org/html/2608.06955#bib.bib34))。一系列并行的工作追问 LLMs 是否持有结构化的态度或价值观。虽然这类取向确实存在,但测量它们对评估设计和提示框架极为敏感(Ma et al. 2024 (https://arxiv.org/html/2608.06955#bib.bib29); Sachdeva and van Nuenen 2025 (https://arxiv.org/html/2608.06955#bib.bib39))。此外,模型规模以意想不到的方式与这些取向相互作用。更大的模型在某些领域表现出更明显的偏见,这一效应归因于预训练期间积累的更广泛知识库(Melotte et al. 2022 (https://arxiv.org/html/2608.06955#bib.bib31)),尽管这些规模效应的方向和幅度主要受底层数据组成的影响(Ali et al. 2024 (https://arxiv.org/html/2608.06955#bib.bib4))。 一个相关但又不同的工作体系考察了基于 LLM 的推荐系统中的文化偏见。应用于电影和音乐推荐的公平性基准表明,输出因用户属性(包括性别、语言和文化背景)而异,某些群体持续获得较不公平的对待(Zhang et al. 2023 (https://arxiv.org/html/2608.06955#bib.bib51))。当存在人口统计学或情境信号(如社会经济地位)时,这些不对称会被放大——主流内容受到青睐,而非传统选项在多样化的用户群体中被边缘化(Sakib and Das 2024 (https://arxiv.org/html/2608.06955#bib.bib40))。即使在用户信息极少的冷启动设置中,模型也会在推荐领域再现性别和文化刻板印象(Andre et al. 2025 (https://arxiv.org/html/2608.06955#bib.bib5))。该文献中的公平性关切主要涉及对不同情境下用户待遇的不平等。这种框架没有解决的问题是,当没有用户画像或推荐上下文来锚定输出时,模型本身的评价取向是什么。 ### 竞争逻辑:评论界赞誉 vs. 大众接受度 先前的工作表明,评论界赞誉和大众接受度都在语言中留下了可恢复的痕迹。Kozlowski et al.(2019 (https://arxiv.org/html/2608.06955#bib.bib26))证明,文化地位等级嵌入在分布式词表示中:例如,“高尔夫”与富裕的关联更紧密,而“拳击”则投射到该维度的另一端。这种声望的编码延伸到特定领域的语料库,从隐藏在餐厅菜单中的社会经济标记(Jurafsky et al. 2016 (https://arxiv.org/html/2608.06955#bib.bib24))到 YouTube 音乐评论中特定体裁的品味等级(Airoldi 2024 (https://arxiv.org/html/2608.06955#bib.bib3))。鉴于这两种合法化形式都会产生独特的语言足迹,一个重要的问题是哪种评价逻辑在 LLM 输出中占主导地位。 人们可能会假设大众接受度会占上风。关于互联网文本人口构成的研究表明,输出偏向西方、受教育、工业化、富裕和民主(WEIRD; Henrich et al. 2010 (https://arxiv.org/html/2608.06955#bib.bib22))人口的观点(Atari et al. 2023 (https://arxiv.org/html/2608.06955#bib.bib7); Abdurahman et al. 2024 (https://arxiv.org/html/2608.06955#bib.bib1); Zhou et al. 2025 (https://arxiv.org/html/2608.06955#bib.bib52))。Gillespie(2024 (https://arxiv.org/html/2608.06955#bib.bib21))记录了 LLM 生成叙事中类似的“隐性规范性”(quiet normativities),即无标记提示会复现带有阶级标记的默认值。按照这种逻辑,一部面向主导人口群体营销并被其讨论的漫威电影,应该在正面比较中产生足够的话语量,以压倒来自全球南方的冷门艺术电影。这种推论假设话语量会转化为被诱发的选择,然而对齐和诱发框架介入了语料库层面的规律与提示时刻浮现出的内容之间。 ### 从 LLM 中诱发偏好 从 LLMs 中提取评价取向是一个方法论问题,与审计表征模式不同。标准对齐干预训练模型抑制明确的价值判断,用含糊或回避性语言中和开放式查询(Ouyang et al. 2022 (https://arxiv.org/html/2608.06955#bib.bib35); Wei et al. 2023 (https://arxiv.org/html/2608.06955#bib.bib49))。然而,接受过假装中立训练的模型在强制选择比较中仍会暴露有偏见的关联(Bai et al. 2025 (https://arxiv.org/html/2608.06955#bib.bib8))。也就是说,成对二元选择通过强制做出决定,有效地绕过了对齐层的拒绝机制。然而,被诱发的信号可能仍然嘈杂,或在不同评估条件下不稳定。例如,LLM 文化对齐分数在呈现格式和提示措
相似文章
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
用于引文功能分类的大型语言模型
本文对五种大型语言模型在引文功能分类任务上进行了全面评估,基于微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最优结果。同时引入了 AC3 数据集,该数据集采用七类别标注方案,能够区分中性致谢与评价性立场。
一些大型语言模型表现出一致的风险态度
本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。
政治话语中大型语言模型的文化适应
本文探讨了在政治话语中使大型语言模型适应文化语境的方法,旨在增进跨文化理解并减少偏见。
超越准确率:大型语言模型统计推理的多维评估
本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。