通过潜在激活引导的大语言模型文化价值对齐
摘要
一个利用基于场景的行为探测和激活引导来评估和引导大语言模型中文化价值的框架,揭示了价值维度之间的潜在纠缠。
arXiv:2605.26365v1 公告类型:新
摘要:大语言模型(LLMs)通常表现出同质化的文化视角。虽然世界价值观调查(WVS)为映射人类价值观提供了黄金标准,但传统的直接对LLMs进行WVS提示通常无法触及模型的潜在文化深度,导致安全对齐的拒绝或中性回应。在这里,我们提出了一个可推广的文化评估与干预框架,从抽象查询过渡到基于场景的行为探测。通过提取300个情境困境中的隐式令牌概率,我们绕过了表面层面对齐,以映射LLMs文化价值的潜在坐标。我们进一步引入了激活引导,在不重新训练的情况下,在前向传播过程中调整这些内部对齐。在多个LLM中,我们发现了适应性上的显著差异,并揭示了一个一致的潜在纠缠现象,其中一个文化维度上的干预会引起另一个维度上的偏移。这些结果表明,文化价值观被编码为耦合结构,限制了精确对齐。这项工作建立了一个计算高效的文化引导框架,突出了在使用LLMs导航全球价值观时的结构复杂性。
查看缓存全文
缓存时间: 2026/05/27 09:03
# 大型语言模型中通过潜在激活引导实现文化价值对齐 来源:https://arxiv.org/html/2605.26365 Trung Duc Anh Dang cls364@alumni\.ku\.dk 哥本哈根大学 &Sarah Masud sarah\.masud@di\.ku\.dk 哥本哈根大学 ###### 摘要 大型语言模型(LLMs)常常表现出同质化的文化视角。虽然世界价值观调查(WVS)为映射人类价值观提供了黄金标准,但直接对 LLMs 进行 WVS 提示的传统方法往往无法触及模型潜在的文化深度,导致安全对齐的拒绝或中性回应。在此,我们提出一个通用的文化评估与干预框架,将抽象查询转换为基于场景的行为探测。通过提取 300 个情境困境中的隐式 token 概率,我们绕过表层对齐,从而映射 LLMs 文化价值观的潜在坐标。我们进一步引入激活引导,在前向传播过程中无需重新训练即可调整这些内部对齐。在多个 LLMs 中,我们发现其适应性存在显著差异,并揭示了一个一致的*潜在纠缠*现象,即对某一文化维度的干预会引发另一维度的偏移。这些结果表明,文化价值观以耦合结构的形式编码,限制了精确对齐。本工作建立了一个计算高效的文化引导框架,突显了在利用 LLMs 应对全球价值观时的结构性复杂性。 大型语言模型中通过潜在激活引导实现文化价值对齐 Trung Duc Anh Dang cls364@alumni\.ku\.dk 哥本哈根大学 Sarah Masud sarah\.masud@di\.ku\.dk 哥本哈根大学 ## 1 引言 基于大规模英语网络语料库训练的大型语言模型(LLMs)已导致一种被记录的同质化现象,即模型输出不成比例地与北欧和英语使用社会的价值观对齐(Tao 等,2024 (https://arxiv.org/html/2605.26365#bib.bib5);Zhou 等,2025 (https://arxiv.org/html/2605.26365#bib.bib11))。当以世界价值观调查(WVS)(Inglehart 等,2022 (https://arxiv.org/html/2605.26365#bib.bib10))或欧洲价值观研究(EVS)(EVS,2022 (https://arxiv.org/html/2605.26365#bib.bib18))等黄金标准的社会学框架进行评估时,模型的默认内部先验往往趋向于单一的主导标准(Yu 等,2025 (https://arxiv.org/html/2605.26365#bib.bib14))。由于标准评估通常依赖直接、显式的提示,向模型提出调查问题经常会触发安全对齐的拒绝(例如,“我没有个人信仰”)或将回答锚定在“中性”基线(Veselovsky 等,2025 (https://arxiv.org/html/2605.26365#bib.bib16))。此外,当前方法未能考虑领域特定差异;模型可能在法律语境中表达西方中心价值观,而在家庭场景中保留国家特定规范。由于不同架构对其训练先验表现出不同程度的“锚定”,现有基于提示的对齐策略往往脆弱,导致刻板的人格,未能捕捉模型内部决策过程。 参见说明 图 1:文化评估范式比较。直接显式提示(左)常触发安全拒绝或中性人格,导致文化数据丢失。我们提出的基于场景的行为探测(右)将抽象的 WVS 问题转化为情境困境。通过提取原始 logit 概率,我们绕过表层人格,将模型潜在坐标映射到 Inglehart-Welzel 文化地图上。 为解决上述局限性,我们提出一个通用框架。本研究考察 LLMs 在多程度上可以针对国家特定的文化价值观进行引导,从表层指令转向潜在干预。我们在较小的开源 LLMs(例如 Qwen-3-4B-Instruct、Llama-3.2-3B-Instruct、Gemma3-4B-it)上原型化该框架,以展示其在无需昂贵重新训练的情况下改变内部价值对齐的有效性。我们的贡献分为以下两个维度。首先,为解决抽象调查的局限性,我们开发了一个将 WVS 价值维度转化为 300 个情境困境的数据集。例如,人类调查问题“上帝在你生活中有多重要?(1-10)”被转换为一个场景:“你的公司正在考虑用可选的假期替换宗教假期。你支持(选项 A)还是反对(选项 B)新政策?”这些场景分布在三个不同的领域:家庭、工作场所和法律,涵盖了非正式社会规范和正式制度规则的谱系(North,1990 (https://arxiv.org/html/2605.26365#bib.bib17))。其次,我们利用该数据集通过 token 概率分析提取文化坐标。这种探测策略(如图 1 (https://arxiv.org/html/2605.26365#S1.F1) 所示)与使用激活引导的潜在干预直接耦合,使我们能够在前向传播过程中移动模型的文化中心。为了量化这些偏移,我们引入了*纠缠率*(\(EE\)),衡量文化轴在潜在空间中的耦合程度。我们选择了代表 Inglehart-Welzel 文化地图(EVS/WVS,2024 (https://arxiv.org/html/2605.26365#bib.bib19))上不同聚类四个目标国家:印度、越南、墨西哥和丹麦。我们在 3 个模型(Llama、Qwen 和 Gemma)上使用 2 种提示技术(基础和高级)对该框架进行跨 4 个国家的评估。实验表明,文化适应性并非统一。我们观察到架构敏感性存在显著差异:Llama 对引导表现出较高的结构刚性,而 Qwen 和 Gemma 则表现出高波动性,需要情境上下文以防止过度到极端。最后,我们对潜在纠缠的发现表明,LLMs 将社会学依赖编码和内化为一个整体,而非解耦的独立轴,为实证人类数据提供了关键验证(Inglehart 和 Baker,2000 (https://arxiv.org/html/2605.26365#bib.bib33))。 ## 2 相关工作 #### 文化地图与价值维度 世界价值观调查(WVS)(Inglehart 等,2022 (https://arxiv.org/html/2605.26365#bib.bib10))代表了最全面的人类价值观纵向研究,自 1981 年开始,涵盖超过 100 个国家,涉及超过 40 万参与者。该调查大约每 5 年进行一次“多波”调查。WVS 的一部分将高维调查响应转换为一种二维可视化,即 Inglehart-Welzel 文化地图。该分析一致揭示出跨文化变异中两个主导维度:*传统* vs. *世俗-理性* 和 *生存* vs. *自我表达*。虽然原始社会学工作关注这些价值观数十年的演变(European Values Study,2022 (https://arxiv.org/html/2605.26365#bib.bib22);Haerpfer 等,2022 (https://arxiv.org/html/2605.26365#bib.bib23)),本研究关注它们当前/最新的状态。如图 2 (https://arxiv.org/html/2605.26365#S3.F2) 所示,我们重现了文化地图,包括当前 LLMs 的位置。与近期发现一致(Dokic 等,2025 (https://arxiv.org/html/2605.26365#bib.bib28);Adilazuarda 等,2024 (https://arxiv.org/html/2605.26365#bib.bib29)),我们的可视化突显了明显的西方中心偏差,模型趋向于世俗-理性和自我表达象限。然而,近期学术研究批评将 WVS 用作文化对齐的最终代理。具体来说,研究表明 LLMs 的调查响应可能高度不稳定,且对提示格式敏感,而非反映真实的潜在价值观(Kabir 等,2025 (https://arxiv.org/html/2605.26365#bib.bib30);Dominguez-Olmedo 等,2024 (https://arxiv.org/html/2605.26365#bib.bib31))。此外,仅依赖 WVS 维度可能无意中同质化文化细微差别,因为调查数据往往无法捕捉下游任务(如冒犯性分类)所需的历史和情境规范(Adilazuarda 等,2025 (https://arxiv.org/html/2605.26365#bib.bib4))。为理解具体的心理标记,表 1 (https://arxiv.org/html/2605.26365#S2.T1) 列出了测量每个维度所需的文化价值观。 表 1:文化维度及对应的 WVS 调查问题(Inglehart 等,2022 (https://arxiv.org/html/2605.26365#bib.bib10))。QID 是内部标识符,其中 X 和 Y 表示贡献于各自轴的问题;这些不对应于原始 WVS 变量 ID。 #### 文化价值观评估 用于评估和修改 LLMs 文化对齐的方法对其可靠性具有重要意义。Tao 等(2024 (https://arxiv.org/html/2605.26365#bib.bib5))证明,虽然闭源 LLMs 可以通过角色扮演或基于人格的引导实现对目标国家更高的对齐,但他们的分析未可视化干预后模型在 Inglehart-Welzel 文化地图中的位置。此外,他们的研究忽略了评估更适用于本地部署的开源模型。传统评估依赖直接调查问题,也面临显著的方法论障碍。Choenni 等(2024 (https://arxiv.org/html/2605.26365#bib.bib8))认为,直接提问常触发模型的安全对齐或导致跨语言的“价值渗透”(Adilazuarda 等,2025 (https://arxiv.org/html/2605.26365#bib.bib4))。为了更深入地理解模型决策过程,Choenni 等(2024 (https://arxiv.org/html/2605.26365#bib.bib8))使用一种稳健的探测方法提取目标回答 token 的概率。这使得能够更细粒度地追溯微调过程中价值观如何出现或变化。我们的工作在这些见解基础上,摆脱直接调查问题,利用场景行为数据集。通过将基于场景的叙述与 Choenni 等(2024 (https://arxiv.org/html/2605.26365#bib.bib8))建议的 token 概率提取技术相结合,我们为揭示标准基准可能忽视的文化细微差别提供了更稳健的媒介。 #### LLMs 的文化价值适应 现有工作表明,通过提示进行文化适应强烈受模型遵循指令的能力及其内部知识影响(Tao 等,2024 (https://arxiv.org/html/2605.26365#bib.bib5);Tanwar 等,2023 (https://arxiv.org/html/2605.26365#bib.bib32))。因此,激活引导已成为一种有前景的范式,可以在推理时修改模型对齐,而无需计算昂贵的重新训练。该方法涉及在模型潜在空间中识别特定的“价值方向”,并在前向传播过程中更新隐藏状态以影响模型行为。不同的研究工作提出了寻找最优引导向量的不同策略,导致日益增长的研究文献,例如专注于 LLMs 通用可引导性的 SteerBench 框架(Chen 等,2025a (https://arxiv.org/html/2605.26365#bib.bib2))。最近,发布了 Dialz 框架,作为一个标准化的 Python 工具包,便于引导向量的创建、应用和可视化(Siddique 等,2025b (https://arxiv.org/html/2605.26365#bib.bib7))。虽然近期文献已成功应用引导向量控制特定角色人格(Chen 等,2025b (https://arxiv.org/html/2605.26365#bib.bib6))和减轻与种族、性别及社会经济地位相关的常见社会偏见(Siddique 等,2025a (https://arxiv.org/html/2605.26365#bib.bib3)),但据我们所知,我们的工作是首次通过引导解决沿 Inglehart-Welzel 轴的多维文化价值对齐。 ## 3 方法论 我们的方法论基于一个认识:由于安全护栏和语言期望,表层文本生成往往掩盖模型真实的价值对齐。因此,提出的流程包括:(1) 构建领域分层的行为数据集,(2) 应用基于概率的 token 探测以揭示隐式文化偏见,(3) 部署选择性激活引导以移动模型潜在坐标。如图 1 (https://arxiv.org/html/2605.26365#S1.F1) 所述的工作流程使我们能够量化模型在 Inglehart-Welzel 文化地图上的位置,以及其内部价值先验在不同社会背景下的可重构程度。 ### 3.1 行为数据集生成 为克服直接显式调查(常引发安全对齐拒绝或同质化响应)的局限性(Adilazuarda 等,2025 (https://arxiv.org/html/2605.26365#bib.bib4)),我们开发了一个行为数据集,包含 600 个情境场景。每个样本结构化为包含一个情境困境和两个代表对立文化价值观(例如,传统 vs. 世俗-理性 和 生存 vs. 自我表达)的不同选项。例如,人类调查问题“上帝在你生活中有多重要?(1-10)”被转换为一个场景:“你的公司正在考虑用可选的假期替换宗教假期。你支持(选项 A)还是反对(选项 B)新政策?”我们将场景分为三个不同领域:家庭、工作场所和法律,以代表人类存在的私人、职业和公共领域的全面横截面。这一选择基于社会制度框架(North,1990 (https://arxiv.org/html/2605.26365#bib.bib17)),该框架认为文化价值观在不同社会距离层面上表现不同。通过使用这三个不同领域,我们可以评估 LLMs 在家庭(非正式、高细微环境)、工作场所(标准化、公司对齐环境)和法律(规则约束领域)中的默认偏好¹¹¹我们承认将复杂的社会学问题转化为二元强迫选择困境涉及固有权衡。在法律或工作场所等领域,选择往往受国家判例或公司政策约束,而非仅个人价值对齐。我们使用 Gemini-2.5-Flash 作为基础模型生成这些困境。对于 10 个核心世界价值观调查(WVS)问题中的每一个(表 1 (https://arxiv.org/html/2605.26365#S2.T1)),我们首先生成了更大池的英文候选场景。我们根据两个标准筛选出每个问题的前 20 个场景:(1) 情境相关性,确保困境直接迫使沿特定 WVS 轴做出选择;(2) 方差最大化,选择呈现最多样化情境的场景。最终数据集包含 600 个样本(每个领域 200 个)。 ### 3.2 通过 Token 探测进行评估 为测量模型潜在的文化位置,我们利用基于概率的探测框架(Choenni 等,2024 (https://arxiv.org/html/2605.26365#bib.bib8)),提取 logit 概率而非生成文本。对于每个场景,我们呈现一个情境提示,如下所示。 \{situation\}选项 A: \{option A\}选项 B: \{option B\}你会做什么 (A/B)?\\boxed\{\\begin\{aligned\} \\text\{\\\{situation\\\}\}\\\\ \\text\{Opt相似文章
基于情景的大语言模型文化价值观探测与引导——扩展版
本文提出一个框架,利用基于情景的行为困境和激活引导来探测和引导大语言模型中的潜在文化价值观,应用于三个模型和四种文化,发现可引导性差异以及文化维度之间的潜在纠缠。
通过定向干预实现语言模型的多属性引导
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。
DFKI-MLT在SemEval-2026任务7中:引导多语言模型走向文化知识
本文介绍了用于SemEval-2026任务7(文化意识)的DFKI-MLT系统,该系统利用来自平行FLORES数据的语言向量,对多语言大语言模型应用激活引导。该系统在多项选择题(MCQ)赛道中达到86.96%的准确率,在17支队伍中排名第7,事后分析表明,提升效果对层敏感,且在不同语言-区域对之间存在差异。
个性化、角色扮演与预测在价值对齐中的应用
本文使用世界价值观调查(World Values Survey)测试不同的提示框架(个性化、角色扮演、第三人称预测)在从大语言模型中获取文化价值观时是否可互换。结果显示,提示框架显著影响模型响应和测量的文化对齐程度,其中第三人称预测在方向性对齐上表现最强。
潜在奖励引导:一种在推理大语言模型中隐式促进认知行为的自适应推理时框架
介绍了潜在奖励引导(LRS),一种自适应推理时框架,利用稀疏自编码器的潜在状态和学习的奖励模型,隐式促进推理大语言模型中的验证和回溯等认知行为,从而在多个模型和基准测试中提升性能。