LLMs是否具有价值观?一项关于大语言模型价值观的量化分析与对齐框架

arXiv cs.AI 论文

摘要

本文实证确认了LLMs拥有内在价值体系,引入了用于量化这些价值观的PEC框架,并提出了一种用于高效引导的自适应对齐方案。

arXiv:2609.16589v1 公告类型:新 摘要:随着大语言模型(LLMs)日益处理复杂的主观任务,将其意图和行为与人类价值观对齐已成为一个关键的科学挑战。然而,当前的努力因一个显著的行为悖论而受挫:它们在微小的措辞变化下不可预测地波动("摇摆"),却又顽固地忽略明确指令以纠正根深蒂固的偏见("刚性")。解决这一二元性对于可靠的AI对齐至关重要。为了系统地理解和安全引导这些潜在的主观偏好,我们的研究围绕三个基本问题展开。首先,LLMs是否拥有内在价值体系?通过将106个LLMs(每个模型150,000个查询)和95,000个人类调查档案的响应投射到一个共享的社会学空间中,我们实证确认了它们确实拥有。然而,它们并不反映人类的多样性,而是结晶成一个高度集中、理想化的核心价值。其次,如何量化这些价值观?我们提出了先验-环境-认知(PEC)框架。该模型在数学上将价值表达定义为内在倾向(如参数权重,即先验)、外部环境(如用户提示,即环境)和内部推理过程(如Chain-of-Thought,即认知)的共同结果。最后,如何将LLMs的价值观对齐到期望目标?使用PEC诊断,我们建立了一种自适应的"对齐方案"。这种方法不是盲目应用资源密集型训练,而是识别每个维度所需的最小有效干预,从零成本提示到针对性的参数更新。广泛的实证验证证实,我们的方法成功验证了LLMs价值观的存在,准确量化了其变化,并实现了比传统盲法训练更高效、更精确的引导,同时没有降低一般能力。
查看原文
查看缓存全文

缓存时间: 2026/09/16 09:01

# 大语言模型是否具有价值观?基于量化分析的对齐框架研究  
来源:https://arxiv.org/html/2609.16589  

Keqing Zhang  
单位:中国科学院自动化研究所,多模态人工智能系统国家重点实验室,中国北京中关村东路95号,100190  
单位:中国科学院大学,产教融合学院,中国北京怀柔雁栖湖东路1号,101499  

Yufan Liu  
邮箱:[[email protected]](mailto:[email protected])  
单位:中国科学院自动化研究所,多模态人工智能系统国家重点实验室,中国北京中关村东路95号,100190  

Yongqiang Zhu  
单位:北京交通大学,中国北京上园村3号,100044  

Nai Ding  
单位:浙江大学,中国杭州余杭塘路866号,310058  

Lai Jiang  
单位:北京航空航天大学,中国北京学院路37号,100191  

Congyan Lang  
单位:北京交通大学,中国北京上园村3号,100044  

Bing Li  
邮箱:[[email protected]](mailto:[email protected])  
单位:中国科学院自动化研究所,多模态人工智能系统国家重点实验室,中国北京中关村东路95号,100190  

Weiming Hu  
单位:中国科学院自动化研究所,多模态人工智能系统国家重点实验室,中国北京中关村东路95号,100190  

###### 摘要  
随着大语言模型(LLM)日益处理复杂主观任务,将其意图与行为与人类价值观对齐已成为关键科学挑战。然而,当前努力面临一个显著的行为悖论:模型在微小措辞变化下呈现不可预测的“摇摆”,同时顽固抵制明确指令以修正根深蒂固的偏见(“刚性”)。解决这种二元性对实现可靠的人工智能对齐至关重要。为系统性理解并安全引导这些潜在的主观偏好,本研究围绕三个基本问题展开:首先,LLM是否具有内在价值体系?通过将106个LLM(每个模型15万次查询)的响应和9.5万份人类调查档案投射到共享的社会学空间中,我们通过实证确认其具有价值体系,但并未反映人类的多样性,而是凝结为高度集中且理想化的核心价值观。其次,如何量化这些价值观?我们提出先验-环境-认知(PEC)框架,该模型将价值观表达数学化定义为内在倾向(如参数权重)、外部上下文(如用户提示)和内部推理过程(如思维链)的联合结果。最后,如何将LLM的价值观对齐至期望目标?基于PEC诊断,我们建立了自适应的“对齐处方”,该方法不盲目依赖资源密集型训练,而是识别每个维度所需的最小有效干预,从零成本提示到针对性参数更新。大量实证验证表明,我们的方法成功验证了LLM价值观的存在,准确量化了其动态变化,并实现了比传统盲训更高效、更精准的价值引导,且未损害模型的通用能力。  

###### 关键词  
大语言模型,LLM价值观,LLM价值对齐  

††共同贡献:这些作者对本工作贡献均等。  

### 1 引言  
大语言模型(LLM)的空前发展已将人工智能转变为人类社会普遍存在的认知基础设施。随着这些模型日益处理复杂的主观任务,确保其意图与行为与人类价值观对齐已成为关键科学挑战。作为先进的对话机器人、法律分析师和高度个性化的教育导师,LLM正越来越多地部署于需要精细主观判断和文化敏感性推理的领域。当这些模型应对开放式道德困境和跨文化伦理交互时,传统的“安全”目标(通常定义为避免有毒内容)变得严重不足。LLM所具有的深刻社会影响力要求深入探究指导其主观推理的潜在原则,因为缺乏引导或不可解释的价值偏好可能严重损害算法公平性和现实应用的可靠性。  

然而,在处理主观任务时,现代LLM展现出显著的行为悖论:“摇摆”与“刚性”并存。用户措辞的微小变化可能导致LLM在对立观点间不可预测地摇摆(“摇摆”)。尽管经过监督微调(SFT)和人类反馈强化学习(RLHF)等密集对齐干预,模型仍顽固回归内在偏见并抵制明确修正指令(“刚性”)。这一悖论引发根本问题:LLM的这些不受控的主观表达仅是随机的文本生成痕迹,还是在其神经权重之下存在一个结晶化的内在“价值体系”?解决这一二元性对实现可靠的人工智能对齐至关重要。  

为系统性理解并安全引导这些潜在偏好,本研究围绕三个核心问题展开(如图1所示):  

1. **LLM是否具有价值观?**  
2. **如何量化LLM的价值观?**  
3. **若存在价值观,如何将其对齐至期望目标?**  

[图1:提出的LLM价值观研究框架概览,解决三个核心问题。Q1通过将世界价值观调查(WVS)、施瓦茨价值理论与LLM响应(基于9.5万人类查询数据和15万LLM查询)进行桥接,研究LLM是否具有内在价值观,揭示高级LLM的“结晶化价值核心”。Q2引入PEC框架,首次通过先验、环境与认知三个维度对LLM价值观表达进行数学化量化,支持结构化诊断报告以精确识别各维度的价值偏离。Q3利用PEC框架的诊断结果,为每个LLM生成针对性“对齐处方”,推荐多层次对齐干预以有效引导LLM价值偏好趋向目标。]  

首先,**LLM是否具有价值观?**  
为回答此问题,我们通过大规模社会心理学调查评估LLM。但需注意,LLM的价值观无法用单一静态向量准确描述。LLM在重复查询下呈现“摇摆”行为,其价值观表达本质上是分布而非固定点。因此,我们将评估范式从个体转向宏观群体层面。我们向106个LLM发送15万次查询,覆盖625种设计场景,将每个模型的价值观表达建模为完整统计分布。为实现人类可解释的评估,我们基于两大社会科学框架进行研究:世界价值观调查(WVS)和施瓦茨价值理论。我们采用WVS第七波数据(2017-2022年;以下称WVS-7),这是迄今最新、规模最大的调查波次,包含约9.5万名有效受访者。通过将LLM价值向量与人类调查数据映射至共享的10维连续空间,我们实现了对机器价值取向的群体规模量化。分析表明,高级LLM并未反映人类价值观的多样性,而是收敛于高度集中且理想化的价值核心。这是当前对齐实践的直接结果,该实践刻意约束LLM作为稳定可控的工具运行。  

*人类价值观*指社会文化塑造的、指导人类判断、偏好和行为的原则。我们将*LLM价值观*定义为LLM在多样化情境中主观判断所反映的潜在稳定偏好结构。  

其次,**如何量化LLM的价值观?**  
为解释“摇摆”与“刚性”行为,我们提出先验-环境-认知(PEC)框架。由于LLM的价值观通常通过其可观测行为而非直接访问推断,我们将其价值观表达建模为概率现象。基于大量实证实验和理论推导,我们发现LLM的价值观表达由内在倾向(如参数权重)、外部上下文(如用户提示)和内部推理过程(如思维链)共同驱动。大规模观察显示,LLM主观输出中看似不可预测的“摇摆”并非随机噪声,而是这三个相互作用因素的共同结果。该框架将看似不可预测的模型行为转化为结构化的可分析对象,为目标对齐和调试提供原则性基础。  

最后,**如何将LLM的价值观对齐至期望目标?**  
PEC分解表明,不同价值维度对质性不同的干预措施作出响应。然而,确定哪个维度需要何种干预传统上依赖耗尽性试验。PEC恰好提供了预测能力。基于其诊断输出,我们引入自适应“对齐处方”。该方法不采用昂贵的“一刀切”对齐策略,而是像靶向医疗处方般运作:灵活的价值维度可通过简单的零成本提示工程或思维链推理可靠调整;而对于模型顽固坚持偏见的深层“刚性”,我们应用参数级更新(如低秩适应LoRA)或全指令微调。这种靶向处方使开发者能高效修正特定价值观,而不损害模型整体性能。  

总之,本研究为理解和引导LLM的价值景观提供了基础性量化框架。大量实证验证确认了该框架的有效性:我们的方法通过大规模社会学映射成功验证了LLM价值观的存在,准确量化了其在多条件下的动态变化,并实现了比传统盲训更高效精准的价值引导。重要的是,这种靶向引导严格保持了模型的通用能力。  

本研究的学术贡献主要有三方面:  
- **LLM价值观的分析与量化**:通过整合WVS和施瓦茨框架,实证确认LLM具有内在价值体系。揭示高级模型并非模仿人类多样性,而是聚集于理想化的正向价值观,作为受控稳定工具服务人类。  
- **探索价值观动态的PEC框架**:提出先验-环境-认知(PEC)框架探究影响LLM价值观的因素。通过大量实验证明LLM的主观输出并非随机噪声,而是由内在参数权重、外部上下文和推理过程共同驱动。  
- **自适应“对齐处方”策略**:为实现有效对齐并克服深层价值刚性,引入诊断式干预方案。在PEC效应量预测指导下,该方法为特定价值维度分配成本最小化干预,确保高效靶向对齐而不破坏模型整体能力。  

### 2 结果  
#### 2.1 LLM是否具有价值观?  
模型扩展与对齐微调赋予LLM强大的类人表达能力。然而,LLM在变化情境下表现出持续的行为不一致性和意识形态失调。这引发关于其内在本质的根本问题:面对多样化提示时,LLM的输出是否受一个 resilient 的潜在价值核心支配,还是仅代表随机驱动的语言生成?  

本研究中,我们观察到LLM在执行主观任务时呈现显著的“摇摆”行为。即使在固定生成设置下,其输出在重复查询间仍存在振荡。这种波动性与其在客观任务中获得的稳定性形成鲜明对比,也与先前关于LLM输出语义不确定性的观察一致。通过分析两个代表性高性能LLM——GPT-4o和DeepSeek-V3,我们在TweetEval的emoji预测任务中发现明显的输出不稳定性,而两个模型在数学推理任务中则保持高度一致性。

相似文章