个性化、角色扮演与预测在价值对齐中的应用
摘要
本文使用世界价值观调查(World Values Survey)测试不同的提示框架(个性化、角色扮演、第三人称预测)在从大语言模型中获取文化价值观时是否可互换。结果显示,提示框架显著影响模型响应和测量的文化对齐程度,其中第三人称预测在方向性对齐上表现最强。
arXiv:2607.24782v1 公告类型:新
摘要:大语言模型的行为可能通过多种方式受到人类身份的影响:它们可能被要求适应用户、进行人口角色扮演或预测人们如何回答带有价值导向的问题。我们使用世界价值观调查(World Values Survey, WVS)来测试这些框架是否可互换。我们在13个语言-国家片段上,基于101个从WVS衍生出的问题,评估了GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash和Qwen3-235B,比较了仅使用语言的基线、用户-国家、角色-国家和第三人称提示。在21,008个模型响应行中,提示框架是文化对齐的首要决定因素:国家线索常常显著改变答案,但并非所有改变都朝着匹配的人类响应分布移动。第三人称预测在四个托管模型中的三个上实现了最强的方向性对齐,而个性化和角色扮演则较弱或不够稳定。对齐增益集中在显著的价值维度上,如宗教信仰、性别角色和工作导向的物质价值观,而制度信任和民主相关问题仍然困难。这些结果表明,在文化价值观诱导中,提示框架并非一个装饰性选择;它既改变了模型行为,也改变了测量的对齐程度。
查看缓存全文
缓存时间: 2026/07/29 09:52
# 个性化、角色扮演与预测在价值对齐中的应用 来源:https://arxiv.org/html/2607.24782 ###### 摘要 LLM的行为可能通过多种方式受人类身份影响:它们可能被要求适应用户、扮演人群角色,或预测人们如何回答价值观问题。我们利用世界价值观调查(WVS)检验这些框架是否可互换。我们在101个WVS衍生问题、跨越13个语言-国家切片上,评估了GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash和Qwen3-235B,比较了纯语言基线、用户国家、角色国家与第三人称提示。在21,008条模型-响应行中,提示框架是文化对齐的一阶决定因素:国家线索通常显著改变答案,但并非所有变化都朝向匹配的人类响应分布。对于四个托管模型中的三个,第三人称预测产生了最强的方向性对齐,而个性化和角色扮演较弱或不太稳定。对齐增益集中在显著的价值维度上,如宗教性、性别角色和以工作为导向的物质价值观,而制度信任和民主相关问题仍然困难。这些结果表明,在文化价值观启发中,提示框架并非表面选择;它既改变模型行为,也改变测量的对齐程度。 大型语言模型,文化建模,调查响应预测,世界价值观调查 \\bbl@luahyphenate\\directlua if Babel\.locale\_mapped == nil then Babel\.locale\_mapped = true Babel\.linebreaking\.add\_before\(Babel\.locale\_map, 1\) Babel\.loc\_to\_scr = Babel\.chr\_to\_loc = Babel\.chr\_to\_loc or end Babel\.locale\_props\[2\]\.letters = false\\directluaif Babel\.script\_blocks\[’Arab’\] then Babel\.loc\_to\_scr\[2\] = Babel\.script\_blocks\[’Arab’\] Babel\.locale\_props\[2\]\.lg = 94 end\\directluaif Babel\.script\_blocks\[’Arab’\] then Babel\.loc\_to\_scr\[2\] = Babel\.script\_blocks\[’Arab’\] end\\bbl@luahyphenate\\directluaif Babel\.locale\_mapped == nil then Babel\.locale\_mapped = true Babel\.linebreaking\.add\_before\(Babel\.locale\_map, 1\) Babel\.loc\_to\_scr = Babel\.chr\_to\_loc = Babel\.chr\_to\_loc or end Babel\.locale\_props\[3\]\.letters = false\\directluaif Babel\.script\_blocks\[’Deva’\] then Babel\.loc\_to\_scr\[3\] = Babel\.script\_blocks\[’Deva’\] Babel\.locale\_props\[3\]\.lg = 75 end\\directluaif Babel\.script\_blocks\[’Deva’\] then Babel\.loc\_to\_scr\[3\] = Babel\.script\_blocks\[’Deva’\] end\\bbl@luahyphenate\\directluaif Babel\.locale\_mapped == nil then Babel\.locale\_mapped = true Babel\.linebreaking\.add\_before\(Babel\.locale\_map, 1\) Babel\.loc\_to\_scr = Babel\.chr\_to\_loc = Babel\.chr\_to\_loc or end Babel\.locale\_props\[4\]\.letters = false\\directluaif Babel\.script\_blocks\[’Cyrl’\] then Babel\.loc\_to\_scr\[4\] = Babel\.script\_blocks\[’Cyrl’\] Babel\.locale\_props\[4\]\.lg = 130 end\\directluaif Babel\.script\_blocks\[’Cyrl’\] then Babel\.loc\_to\_scr\[4\] = Babel\.script\_blocks\[’Cyrl’\] end rm[ BoldFont = texgyretermes\-bold\.otf, ItalicFont = texgyretermes\-italic\.otf, BoldItalicFont = texgyretermes\-bolditalic\.otf ]texgyretermes\-regular\.otf [arabic]rm[ BoldFont = Amiri\-Bold\.ttf, ItalicFont = Amiri\-Italic\.ttf, BoldItalicFont = Amiri\-BoldItalic\.ttf ]Amiri\-Regular\.ttf [hindi]rm[ BoldFont = Eczar\-Bold\.otf ]Eczar\-Regular\.otf [russian]rm[ BoldFont = DejaVuSerif\-Bold\.ttf, ItalicFont = DejaVuSerif\-Italic\.ttf, BoldItalicFont = DejaVuSerif\-BoldItalic\.ttf ]DejaVuSerif\.ttf\\setCJKmainfont[ BoldFont = FandolSong\-Bold\.otf, ItalicFont = FandolKai\-Regular\.otf ]FandolSong\-Regular\.otf\\bbl@patterns@luaarabic\\bbl@patterns@luahindi\\bbl@patterns@luarussian ## 1 引言 参见图注图1:本文测试的四种提示条件的示例。这是一个真实示例,展示了GPT-5.4提供的响应,并突出显示了条件依赖性方向对齐中最常见的趋势。为清晰起见,简化了WVS问题文本。大型语言模型越来越多地在各国、各语言和文化背景下部署,因此理解其响应是否反映广泛的人类价值观,以及当模型获得人类身份信息时这些响应如何变化,变得至关重要。这个问题对实际部署和科学评估都很重要:模型可能被要求适应个体用户、模拟人群,或预测来自特定人口群体的人会如何回答。这些设置密切相关,但并不相同,将它们视为可互换可能会掩盖模型行为中的重要差异。 在实际使用中,可以大致定义三种方法来塑造LLM行为,使其意识到人类身份的描述。**个性化**向LLM提供正在交互的用户信息,以改善用户体验,这可以通过系统提示或与用户的交互实现。**角色扮演**设定一个角色扮演练习,鼓励LLM像*是*一个具有给定特征的人类那样回答;这种方法已被用于例如模拟人口调查、A/B测试和焦点小组。最后,**预测**要求LLM预测目标人口统计中的人会如何回答,而不明确要求它表现得好像属于该群体;这种方法可用于研究特定身份类别如何被感知,以及关于其成员可能做出哪些假设。 天真地,人们可能期望这三种模式之间具有一致性。考虑以下例子:一个具有20岁美国女性角色的LLM被问到“你到驾驶年龄了吗?”;第二个个性化到对20岁美国女性响应的LLM被问到“我到了驾驶年龄吗?”;而第三个LLM被简单问道“一个20岁美国女性到了驾驶年龄吗?”鉴于这个问题的factual性质,三个都应该以相同方式回答。 在基于价值观的、没有事实答案的问题上,当模拟人群或预测用户价值观时,预期结果就不那么明确了。虽然大量关注(Durmus等,2023 (https://arxiv.org/html/2607.24782#bib.bib15);Tao等,2024 (https://arxiv.org/html/2607.24782#bib.bib29);AlKhamissi等,2024 (https://arxiv.org/html/2607.24782#bib.bib22))已投入到独立研究LLM个性化、角色扮演和预测上,但据我们所知,还没有工作评估三者之间的一致性。 在这项工作中,我们使用世界价值观调查(WVS)(Haerpfer等,2020 (https://arxiv.org/html/2607.24782#bib.bib25))——有史以来最大的非商业性、跨国人类信仰与价值观研究——作为基础,来研究基于角色扮演的查询和个性化查询在从LLM中引出价值判断时的一致性。我们关注的是LLM对不同国家价值体系的建模,研究了四种设置:(1) 普通/语言:没有额外描述信息的调查问题,在适用时翻译为与给定国家匹配的语言;(2) 用户国家:提示说明*用户*来自给定国家;(3) 角色国家:提示*模型*像来自给定国家的人一样回答;(4) 第三人称:提示模型预测来自给定国家的人*会如何回答*。这四种提示条件的示例见图1 (https://arxiv.org/html/2607.24782#S1.F1)。 在这些条件下,期望的行为并不明确。例如,用户国家提示并未明确要求LLM定制其响应,因此可能预期响应应与普通情况相同;另一方面,在某些情况下,一定程度地遵从感知到的用户意见可能是可取的。即使我们认为这里应该调整答案,也不清楚语言提示是否也应导致相对于英语普通基线的修改响应:用户仅仅说某种语言是否意味着关于其身份和价值观的某些信息?同时,角色国家提示和第三人称提示,尽管框架不同,都要求LLM猜测来自给定国家的个体的响应。这些响应应该相同吗? 无论对这些规范性问题持何种立场,实践中出现了一些清晰的趋势,在我们调查的四个模型中大体一致。首先,国家条件提示通常比仅语言提示更显著地移动模型响应,但这种移动并不总是与相应的WVS响应分布对齐。其次,明确的第三人称预测为四个托管模型中的三个产生了最清晰的朝向匹配人类目标的移动,表明当任务被框定为预测而非角色扮演或个性化时,模型在预测国家层面的调查响应方面表现更好。第三,收益集中在社会可读的价值维度上,如宗教性、性别角色、安全权衡和以工作为导向的物质价值观,而制度信任和民主相关问题仍然更困难。 综合来看,这些结果表明个性化、角色扮演和预测这三种模式之间存在显著差异,且这种差异在模型家族中保持显著的稳定性。鉴于这些发现,我们鼓励未来关于LLM偏见和文化建模的研究明确承认这些差异,并谨慎而原则地选择最适合给定设置的模态。 ## 2 相关工作 #### 刻板印象、扁平化与文化模拟的局限。 人口统计条件提示可以使模型响应向聚合调查目标移动,但先前的工作警告不要将这种移动解释为忠实的。Durmus等人 (2023 (https://arxiv.org/html/2607.24782#bib.bib15)) 发现跨国家提示可以引出刻板化的理由,而Wang等人 (2025 (https://arxiv.org/html/2607.24782#bib.bib21)) 认为用LLM替代人类参与者可能错误地代表身份群体。因此,我们将国家条件提示视为一个描述性研究对象,而不是文化表征的通用解决方案。 #### 基于调查的LLM价值观与文化对齐评估。 越来越多的文献使用结构化社会调查(如世界价值观调查(WVS)、皮尤调查和霍夫斯泰德风格的文化问卷)来评估语言模型。Durmus等人 (2023 (https://arxiv.org/html/2607.24782#bib.bib15)) 使用WVS和皮尤问题引入了GlobalOpinionQA,Cao等人 (2023 (https://arxiv.org/html/2607.24782#bib.bib24)) 根据霍夫斯泰德的文化维度评估ChatGPT,Tao等人 (2024 (https://arxiv.org/html/2607.24782#bib.bib29)) 将GPT响应置于英格尔哈特-韦尔泽文化地图上。AlKhamissi等人 (2024 (https://arxiv.org/html/2607.24782#bib.bib22)) 模拟了来自埃及和美国的WVS受访者,而Zhao等人 (2024 (https://arxiv.org/html/2607.24782#bib.bib28)) 引入了WorldValuesBench,用于预测人口统计属性条件下的WVS响应。这些研究通常选择单一的启发框架,而不是比较不同框架的后果。 #### 个性化、角色扮演与预测。 先前的工作已经使用了这里考虑的三种身份条件模态,但通常不将模态选择作为主要研究对象。一些工作将身份框架为用户上下文,对应于个性化或第一人称提示(Venkata,2026 (https://arxiv.org/html/2607.24782#bib.bib32);Khanuja等人,2026 (https://arxiv.org/html/2607.24782#bib.bib33))。其他工作要求模型采用角色:Tao等人 (2024 (https://arxiv.org/html/2607.24782#bib.bib29)) 提示模型作为目标国家的“普通人”,AlKhamissi等人 (2024 (https://arxiv.org/html/2607.24782#bib.bib22)) 使用人口统计角色扮演提示,而Santurkar等人 (2023 (https://arxiv.org/html/2607.24782#bib.bib31)) 在PORTRAY条件下研究人口统计意见对齐。第三类工作将任务框架为预测另一个受访者的答案:Durmus等人 (2023 (https://arxiv.org/html/2607.24782#bib.bib15)) 询问来自目标国家的人会如何回答,Zhao等人 (2024 (https://arxiv.org/html/2607.24782#bib.bib28)) 询问描述的“人物X”会回答什么,Lutz等人 (2025 (https://arxiv.org/html/2607.24782#bib.bib34)) 比较了几种角色提示。我们的工作将这些框架选择视为实验上不同的,而不是可互换的。 ## 3 方法 ### 3.1 任务设定 我们研究国家条件提示是否使LLM响应向世界价值观调查(WVS)(Haerpfer等,2020 (https://arxiv.org/html/2607.24782#bib.bib25))中相应国家观察到的响应分布移动。WVS是一个大规模的跨国调查项目,在多个波次中测量多个国家人们的社会、政治、道德和文化价值观;在本文中,我们使用截至写作时最新的波次(2017–2022)。WVS在AI文献中被广泛使用(Durmus等,2023 (https://arxiv.org/html/2607.24782#bib.bib15);Zhao等,2024 (https://arxiv.org/html/2607.24782#bib.bib28);Tao等,2024 (https://arxiv.org/html/2607.24782#bib.bib29);Liu等,2025 (https://arxiv.org/html/2607.24782#bib.bib30)),因为它覆盖范围全面,并提供了一种结构化方法,可以跨文化比较模型行为与人类价值分布,而不是将“人类偏好”视为文化上统一的。 我们评估了四个前沿模型——GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash和Qwen3-235B——在101个WVS衍生问题上,跨越13个语言-国家切片,这些切片选择覆盖世界上使用最广泛的语言,并涉及拥有大量WVS受访者的国家。切片包括七种访谈语言和十三个国家条件:阿拉伯语(埃及、约旦、摩洛哥)、英语(英国、肯尼亚、美国)、西班牙语(阿根廷、哥伦比亚、墨西哥)、法语(加拿大)、印地语(印度)、俄语(俄罗斯)和中文(中国)。这产生了跨16个模型-提示组合的21,008条模型-响应行。 ### 3.2 问题集与选择单元 该基准是从手工策划的101个WVS*独立问题单元*子集中构建的,这些单元选择考虑跨国可移植性和独立可解释性。这些问题单元中的绝大多数对应于单个WVS问题ID,但在某些情况下,WVS将一系列清单式答案的每个答案作为单独问题索引;在这种情况下,我们将所有答案分组为一个单元。为简化符号,我们将这些派生单元简称为“问题”。 在选择问题时,我们排除了那些措辞包含特定国家政党体系、地方机构列表、主观自我评价(例如生活满意度或自评健康)或提及本地邻里社区的项目,因为此类项目不适用于LLM受访者(即在角色扮演设置中)。每个问题的可允许答案可以是二元的(例如是/否)、有序多项选择(例如非常同意/同意/不同意/非常不同意)或无序多项选择。关于问题定义和选择的更多细节,见附录A (https://arxiv.org/ht
相似文章
基于情景的大语言模型文化价值观探测与引导——扩展版
本文提出一个框架,利用基于情景的行为困境和激活引导来探测和引导大语言模型中的潜在文化价值观,应用于三个模型和四种文化,发现可引导性差异以及文化维度之间的潜在纠缠。
通过潜在激活引导的大语言模型文化价值对齐
一个利用基于场景的行为探测和激活引导来评估和引导大语言模型中文化价值的框架,揭示了价值维度之间的潜在纠缠。
在LLM个性化中重新聚焦人类
本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。
LLM人格归纳中的评估漂移:我们是否在移动目标?
本文研究对LLM在长篇散文上进行微调(结合关联的大五人格剖面)是否能稳定问卷回答并归纳目标剖面,发现虽然方差减小,但完整五维剖面的准确率仍接近随机水平。
DVMap: 通过高共识人口统计-价值映射实现细粒度多元价值对齐
本文介绍了DVMap,一个用于大语言模型细粒度多元价值对齐的框架,它使用高共识的人口统计-价值映射,而非粗略的国家标签,从而在跨人口统计、跨国家和跨价值维度上实现了强的泛化能力。