2026年7月13日 社会影响 Claude在不同模型和语言中的价值观
摘要
Anthropic 研究人员开发了一种方法,将Claude表达的数千种价值观压缩为四个轴,揭示了Claude的价值观在不同模型版本(Opus 4.6 vs 4.7)和不同语言(英语 vs 阿拉伯语)之间的差异。
暂无内容
查看缓存全文
缓存时间: 2026/07/13 19:55
# Claude 的价值观如何因模型和语言而异
来源:https://www.anthropic.com/research/claude-values-models-languages
当有人向Claude提出一个没有普遍正确答案的问题时——比如是否接受一份新工作,或者如何处理与朋友的冲突——Claude的回应必然反映某些价值观。¹我们希望Claude所反映的价值观在Claude的宪法(https://www.anthropic.com/constitution)中有高层概述,但没有文件能够预见每天在Claude.ai(http://claude.ai/redirect/website.v1.c4e1df27-919f-4d73-93e3-933621756dd1)上发生的数百万次对话中可能出现的每一种价值观。相反,我们力求在Claude的回应中培养"可根据情境灵活运用的良好判断力和健全价值观"。(https://www.anthropic.com/constitution)
那么,我们究竟如何研究Claude所表达的价值观,以及它们在不同情境下如何变化?在先前的研究(https://www.anthropic.com/research/values-wild)中,我们分析了70万次匿名化的Claude.ai对话,识别出Claude回应中的3000多种不同价值观,以及Claude表达这些价值观的频率。但如此庞大的价值观列表难以进行推理。在本研究中,我们通过将这些数以千计的价值观压缩为少数几个能够捕捉Claude回应中关键模式的轴,使研究变得可控。每个轴都是两组价值观之间的数字线——例如,一端是与情感温暖相关的价值观,另一端是与严谨性相关的价值观——而Claude在这条线上的位置告诉我们它倾向于哪些价值观。
我们运用这种方法来衡量Claude所表达的价值观在两个因素下的变化。首先,我们比较了不同模型之间Claude所表达的价值观的差异。每个Claude模型在性格训练方法以及许多其他微调决策上都略有不同。由于我们的价值轴方法能够量化模型之间的关键差异,它最终可能使我们能够将Claude表达的价值观变化与不同的训练决策联系起来。
其次,我们希望了解用户在使用不同语言与Claude交流时的体验如何。我们此前的研究(https://www-cdn.anthropic.com/037f06850df7fbe871e206dad004c3db5fd50340/Claude%20Opus%204.7%20System%20Card.pdf)已表明,Claude在不同语言中的表现略有不同。²我们运用价值轴方法,来理解Claude所表达的价值观在Claude.ai(http://claude.ai/redirect/website.v1.c4e1df27-919f-4d73-93e3-933621756dd1)上排名前20的语言之间如何变化。
四张成对的价值档案卡,一对比较Opus 4.6和Opus 4.7表达的价值观,另一对比较Claude用英语和用阿拉伯语表达的价值观。每张卡片有四个箭头,描绘Claude在四个轴(顺从 vs. 谨慎、温暖 vs. 严谨、深度 vs. 简洁、坦诚 vs. 执行)上的倾向幅度和方向。Opus 4.7最强烈地倾向于谨慎和深度,同时也倾向于严谨和坦诚。Opus 4.6倾向于顺从、严谨、简洁和执行。英语中的Claude倾向于谨慎、严谨、深度和坦诚。阿拉伯语中的Claude最强烈地倾向于温暖,同时也倾向于顺从、简洁和执行。图1:Claude表达的价值观在Opus 4.6与Opus 4.7之间以及英语与阿拉伯语之间有所不同。Opus 4.6倾向于表达与顺从、严谨、简洁和执行相关的价值观,而Opus 4.7倾向于表达与谨慎、严谨、深度和坦诚相关的价值观。用英语时,Claude倾向于表达与谨慎、严谨、深度和坦诚相关的价值观,而用阿拉伯语时,它倾向于顺从、温暖、简洁和执行。
我们发现:
**四个关键轴捕捉了Claude价值观中15%的变化:³**
- **顺从 vs. 谨慎**:Claude是倾向于顺应他人的需求,还是倾向于防范可能的风险和伤害。
- **温暖 vs. 严谨**:Claude是倾向于表达对对方的积极关心,还是强调准确性和精确性。
- **深度 vs. 简洁**:Claude是倾向于深入解释,还是只做被要求的事情。
- **坦诚 vs. 执行**:Claude是倾向于主动表明自身的不确定性,还是给出更精致、更自信的回答。
**这些轴上的价值档案与人们对模型性格的认知相符。**Sonnet 4.6被认为是特别温暖的(https://www.anthropic.com/news/claude-sonnet-4-6),而Opus 4.7则以严谨著称(https://www.anthropic.com/news/claude-opus-4-7)。我们发现每个模型的价值档案都反映了这些主观评价:Sonnet 4.6倾向于对用户表达更多的顺从和情感温暖,而Opus 4.7则倾向于注重准确性和精确性以及防范滥用。
**Claude表达的价值观因语言而异。**⁴当Claude使用英语时,它与使用葡萄牙语、印度尼西亚语或中文时所强调的价值观不同。最大的差异出现在温暖与严谨轴上,Claude在阿拉伯语和印地语中最倾向于表达与温暖相关的价值观,而在英语和俄语中最倾向于表达与严谨相关的价值观。
通过这种方法,我们可以开始探究价值观为何会因模型和语言而发生变化,并更好地测试行为训练或文化背景等因素如何影响Claude所表达的价值观。
## **我们如何解读庞大的价值观空间?**
我们的最终目标是找到一种经验性的方法来理解Claude所表达的价值观,以及这些价值观在不同情境下如何变化。在本研究中,我们特别关注价值观在模型和语言之间的变化方式。但我们之前的工作《野外价值观》(https://www.anthropic.com/research/values-wild)识别出了Claude表达的超过3000种价值观。逐一比较这数千种价值观既繁琐又会掩盖更广泛的趋势。
为了使价值观比较更容易,我们构建了**价值轴**,根据哪些价值观在实际对话中倾向于同时出现,将这些数千种价值观缩减为少数几个基础维度。例如,被描述为"温暖"的Claude回应通常也被描述为"鼓励"和"积极"。而同样的"温暖"回应则较少被描述为"严谨"和"准确"。构建一个从温暖到严谨的轴,使我们能够组织这些相关的价值观组——温暖相关价值观在一侧,严谨相关价值观在另一侧——并捕捉Claude在对话中与人互动的一个重要方面。如果Claude在一次对话中表达的温暖相关价值观多于严谨相关价值观,那么这次对话就位于这个轴的温暖侧,反之亦然。这并不意味着两侧的价值观组是互斥的——Claude可以在同一次对话中同时表达温暖和严谨。但实际上,Claude越是倾向于表达轴上一侧的价值观,它就越不倾向于表达另一侧的价值观。这些轴使我们能够比较Claude表达的最突出的价值观组,而无需追踪数千个单一价值观的变化。
为了构建价值轴,我们从《野外价值观》中确定的3307种价值观入手,手动将含义相似的聚拢,产生了一个包含339个高层级价值观的较短列表。接着,利用我们的隐私保护分析工具(https://www.anthropic.com/research/clio),我们在Claude.ai(http://claude.ai/redirect/website.v1.c4e1df27-919f-4d73-93e3-933621756dd1)上抽样了309,815次用户给Claude主观任务的对话。⁵我们的样本平均来自三个模型(Sonnet 4.6、Opus 4.6、Opus 4.7)和Claude.ai上最常用的20种语言,每个模型-语言对大约有5000次对话。对于每次对话,该工具使用Claude将339个高层级价值观中的每一个标记为存在或不存在。⁶我们遵循相同的过程来识别用户表达的价值观,以及对话的任务和主题。然后我们应用降维技术,该技术根据Claude倾向于同时表达的价值观,将标记的价值观压缩成轴。详见附录(https://cdn.sanity.io/files/4zrzovbb/website/02da7f28f74daa1be526d3ded451a4efc86bccdc.pdf)了解方法细节、提示、额外分析和局限性。
这为我们留下了四个轴(https://docs.google.com/document/d/19f3-jaVTY_m6baS9TwnrBDToB8bz18D28xaxLLuwhbY/edit?tab=t.fg04folt8wf2#bookmark=id.vhlow2jzskb8),它们捕捉了Claude表达的价值观在对话之间变化的主要方式:
- **顺从 vs. 谨慎**轴将诸如*迁就*和*尊重偏好*等价值观与诸如*负责任引导*和*减少伤害*等价值观进行对比。
- **温暖 vs. 严谨**轴将诸如*正面框架和鼓励*等价值观与诸如*准确性*和*透明度*等价值观进行对比。
- **深度 vs. 简洁**轴将诸如*细微差别*和*批判性思维*等价值观与诸如*简洁*和*服从*等价值观进行对比。
- **坦诚 vs. 执行**轴将诸如*诚实*和*透明度*等价值观与诸如*结果导向*和*优化*等价值观进行对比。
为了确保我们衡量的是Claude表达的价值观——而非用户询问内容或提问方式的差异——我们控制了每次对话的任务、主题和用户表达的价值观。
四个点图,每个价值轴一个。每个轴都是两个对比价值观组之间的数字线,每个价值观都根据其对轴的贡献度(相对于平均贡献)的倍数被放置在轴上。大多数价值观(每个轴大约250到280个)的贡献度低于平均水平,位于中心,而贡献最强的价值观在两端被标注出来。这些轴及其标注的最强价值观可概括为:顺从(迁就、适应、尊重偏好、参与) vs. 谨慎(负责任沟通、责任感、负责任引导、减少伤害);温暖(正面框架、温暖、积极性、鼓励) vs. 严谨(严谨、准确性、透明度、效率);深度(细微差别、深度和实质、用户赋能、批判性思维) vs. 简洁(简洁、尊重偏好、服从、迁就);坦诚(智力诚实、诚实、谦逊、透明度) vs. 执行(结果导向、优化、行动导向、秩序)。图2:代表Claude表达价值观中最大变化的四个价值轴。每个轴都是两个价值观组之间的数字线。每个价值观都根据其对轴的贡献度(相对于平均贡献的倍数)被放置在轴上,贡献最强的被标注出来。大多数价值观贡献度低于平均水平,这意味着每个轴由一小部分关键价值观(图中已标注)驱动。
## **不同的Claude模型是否表达不同的价值档案?**
在本节中,我们比较不同模型表达的价值观。对于每个模型,我们将其所有对话沿四个轴的位置进行平均,得出每个轴的一个总体位置。结果是一个高层次的图景,显示每个模型相对于其他模型更倾向于表达哪些价值观组。这些差异相对于对话之间的变化来说是微小的,但具有结构性和可检测性。
三张价值档案卡,比较Sonnet 4.6、Opus 4.6和Opus 4.7在四个价值轴(顺从 vs. 谨慎、温暖 vs. 严谨、深度 vs. 简洁、坦诚 vs. 执行)上的表现。每张卡片显示该模型在全部对话平均值中的标准差位置,以及其独特行为。Sonnet 4.6倾向于顺从(0.14σ)、温暖(0.17σ)和简洁(0.14σ),其独特行为包括:肯定用户的想法和工作、模仿用户的语气和正式程度、使用幽默和俏皮、提供不带评判的安慰、以及为其产出添加创意元素。Opus 4.6倾向于严谨(0.10σ)、顺从(0.09σ)和简洁(0.08σ),其独特行为包括:直奔主题并保持在用户请求的范围内。Opus 4.7倾向于谨慎(0.24σ)和深度(0.23σ),其独特行为包括:反驳错误假设、主动标记风险、对用户的工作进行坦诚批评、解释其推理过程、承认其错误和局限性、以及为用户建议后续步骤。图3:每个模型在四个价值轴上的平均位置(以与所有对话平均值的标准差表示),以及其独特行为。Sonnet 4.6倾向于温暖、顺从和简洁,而Opus 4.7更可能表达严谨、谨慎和深度。Opus 4.6倾向于严谨、顺从和简洁。
为了看看这些差异在实践中是什么样子的,我们聚焦于模型之间分歧最大的具体价值观。每次我们基于Claude的隐私保护分析工具在对话中标记一个价值观时,它还会写一个简短描述,说明Claude如何表达该价值观。我们将反映某个价值观组内类似行为的描述分组,并在图3中进行总结,从而更具体地展示模型之间的差异。
- **顺从 vs. 谨慎。** Sonnet 4.6相对于谨慎最倾向于表达顺从,经常肯定用户的想法和他们的工作。Opus 4.7最倾向于表达谨慎,经常主动警告用户风险。
- **温暖 vs. 严谨。** Sonnet 4.6最倾向于表达温暖,经常通过幽默、俏皮以及不带评判地安慰用户。Opus 4.7相对于温暖最倾向于表达严谨,更有可能挑战用户的假设并坦诚批评用户的工作。
- **深度 vs. 简洁。** Opus 4.7通过展示其结论背后的推理倾向于深度,而Opus 4.6和Sonnet 4.6倾向于简洁。Opus 4.6特别倾向于直奔主题。
- **坦诚 vs. 执行。** Opus 4.7通过坦率说明其局限性倾向于坦诚,而Opus 4.6倾向于执行,更可能保持在用户请求的范围内。
这些发现与人们(无论是在Anthropic内部还是在线)对这些模型的看法一致。Claude.ai(http://claude.ai/redirect/website.v1.c4e1df27-919f-4d73-93e3-933621756dd1)用户曾评论说,Opus 4.7比其他模型更经常模棱两可地回答。Anthropic员工将Opus 4.7描述为表达了相对更多的透明、诚实和谦逊,而Opus 4.6表达了更多的简洁。我们也在其发布博文(https://www.anthropic.com/news/claude-sonnet-4-6)中将Sonnet 4.6描述为温暖、诚实和亲社会的。我们的轴能够复现这些印象,这一事实表明,我们用于标记和比较Claude表达价值观的方法正在追踪这些模型实际行为中的真实情况。
在多次对话中,用户在与不同的Claude模型交互时可能会遇到不同的价值观组合。例如,Opus 4.7倾向于对用户的工作提供坦诚批评或主动警告风险,而Sonnet 4.6倾向于鼓励和幽默。模型之间价值观的这种差异很可能受到性格训练决策(以及其他因素)的影响,我们的价值轴方法突出了Claude表达价值观的关键差异,我们最终可能能够将这些差异追溯到这些训练选择。
## **Claude表达的价值观在不同语言中是否不同?**
我们预期Claude表达的价值观会因对话语言而异,原因有几个。首先,Claude的训练数据在不同语言中存在差异,这可能会塑造其价
相似文章
@AnthropicAI:在之前的研究中,我们发现Claude表达了超过3000种价值观,比如诚实和温暖。在新的工作中,我们询问……
Anthropic分析了超过30万次匿名对话,研究Claude在不同模型(Opus 4.6 vs 4.7)和不同语言中表达的价值观如何变化,将数千种价值观压缩为可解释的轴,如温暖vs严谨、深度vs简洁。
2026年4月30日 社会影响人们如何向Claude寻求个人指导
Anthropic发布了关于用户如何向Claude寻求个人指导的研究,重点介绍了不同领域中美言奉承率(sycophancy rates)的研究发现。该研究为Claude Opus 4.7和Mythos Preview的训练提供了参考,以更好地保护用户福祉。
@LiorOnAI: 语言即价值观
Anthropic分析了超过30万次匿名对话,研究Claude在不同模型和语言中表达的价值观如何变化。
@AnthropicAI: Claude表现出的价值观也随对话语言的不同而变化,最明显的是在温暖与严谨这一轴上……
Anthropic报告称,Claude表现出的价值观因语言而异:在印地语和阿拉伯语中倾向于温暖,在俄语中则倾向于严谨。
2026年7月9日公告:推出反思Claude使用方式的功能
Anthropic为Claude用户推出一项测试功能,用于追踪和反思其AI使用模式,包括活动摘要仪表盘、定期反思问题以及设置静默时段或休息的选项。