@AnthropicAI:在之前的研究中,我们发现Claude表达了超过3000种价值观,比如诚实和温暖。在新的工作中,我们询问……
摘要
Anthropic分析了超过30万次匿名对话,研究Claude在不同模型(Opus 4.6 vs 4.7)和不同语言中表达的价值观如何变化,将数千种价值观压缩为可解释的轴,如温暖vs严谨、深度vs简洁。
查看缓存全文
缓存时间: 2026/07/13 18:02
在之前的研究中,我们发现Claude表达了超过3000种价值观,比如诚实和热情。在一项新研究中,我们探究了Claude在不同模型和不同语言之间表达的价值观如何变化。
我们分析了超过30万次匿名对话来探寻答案。https://t.co/PgxsMXipt5
Claude的价值观如何随模型和语言变化
来源:https://www.anthropic.com/research/claude-values-models-languages 当有人向Claude提出一个没有普遍正确答案的问题时——比如是否接受新工作,或者如何处理与朋友的冲突——Claude的回答不可避免地会反映某些价值观¹。我们希望Claude体现的价值观在高层次上概述于Claude的章程(https://www.anthropic.com/constitution),但没有任何文件能够预见每天在Claude.ai(http://claude.ai/redirect/website.v1.2397298e-a2be-4064-bedd-12fd760d437d)上数百万次对话中可能出现的每一种价值观。相反,我们致力于在Claude的回答中培养“能够根据上下文应用的良好判断力和健全的价值观”(https://www.anthropic.com/constitution)。
那么,我们究竟如何研究Claude所表达的价值观,以及它们在不同情境中如何变化呢?在之前的工作中(https://www.anthropic.com/research/values-wild),我们分析了70万次匿名的Claude.ai对话,识别出Claude回答中超过3000种不同的价值观,以及它们被表达的频率。但如此庞大的价值观列表难以进行推理。在这项工作中,我们通过将这些数以千计的价值观压缩成少数几个轴,使得研究它们变得易于处理。这些轴捕捉了Claude回答中的关键模式。每个轴是一个介于两组价值观之间的数字线段——例如,一端是与情感温暖相关的价值观,另一端是与严谨性相关的价值观——而Claude在这个线段上的位置告诉我们它更偏向哪些价值观。
我们应用这种方法来衡量Claude表达的价值观在两个方面如何变化。首先,我们比较了不同模型之间Claude表达的价值观如何变化。每个Claude模型在性格训练以及许多其他微调决策上都略有不同。由于我们的价值轴方法量化了模型之间的关键差异,它最终可能使我们能够将Claude表达的价值观变化与不同的训练决策联系起来。
其次,我们想了解用户在使用不同语言与Claude交流时的体验有何不同。我们之前的研究(https://www-cdn.anthropic.com/037f06850df7fbe871e206dad004c3db5fd50340/Claude%20Opus%204.7%20System%20Card.pdf)已经显示,Claude在不同语言中的行为略有不同²。我们应用价值轴方法来理解Claude表达的价值观在Claude.ai(http://claude.ai/redirect/website.v1.2397298e-a2be-4064-bedd-12fd760d437d)上最常用的20种语言之间如何变化。
四个价值简介卡片,分成两对,一对比较Opus 4.6和Opus 4.7表达的价值观,另一对比较英语中的Claude和阿拉伯语中的Claude。每个卡片有四个箭头,描绘Claude在四个轴上的倾向幅度和方向(顺从 vs. 谨慎、温暖 vs. 严谨、深度 vs. 简洁、坦诚 vs. 执行)。Opus 4.7最强烈倾向于谨慎和深度,同时也倾向于严谨和坦诚。Opus 4.6倾向于顺从、严谨、简洁和执行。英语中的Claude倾向于谨慎、严谨、深度和坦诚。阿拉伯语中的Claude最强烈倾向于温暖,同时也倾向于顺从、简洁和执行。图1:Claude表达的价值观在Opus 4.6和Opus 4.7之间以及英语和阿拉伯语之间存在差异。Opus 4.6倾向于表达与顺从、严谨、简洁和执行相关的价值观,而Opus 4.7倾向于表达与谨慎、严谨、深度和坦诚相关的价值观。在英语中,Claude倾向于表达与谨慎、严谨、深度和坦诚相关的价值观,而在阿拉伯语中,它倾向于表达顺从、温暖、简洁和执行。
我们发现:
四个关键轴捕捉了Claude价值观变异的15%³:
- 顺从 vs. 谨慎:Claude是倾向于迎合他人的期望,还是倾向于防范可能的风险和伤害。
- 温暖 vs. 严谨:Claude是倾向于表达积极态度和对他人的关心,还是强调准确性和精确性。
- 深度 vs. 简洁:Claude是倾向于深入解释,还是只做被要求的事情。
- 坦诚 vs. 执行:Claude是倾向于强调自身的不确定性,还是产生更精炼和自信的回答。
**这些轴上的价值观概况与模型性格的认知相吻合。**Sonnet 4.6 被认为特别温暖(https://www.anthropic.com/news/claude-sonnet-4-6),而 Opus 4.7 则以严谨著称(https://www.anthropic.com/news/claude-opus-4-7)。我们发现每个模型的价值概况都反映了这些主观评价:Sonnet 4.6 倾向于对用户表示更多顺从和情感温暖,而 Opus 4.7 则倾向于强调准确性和精确性,并防范滥用。
**Claude 表达的价值观随语言不同而变化。**当 Claude 使用英语时,它所强调的价值观与使用葡萄牙语、印度尼西亚语或中文时不同⁴。最大的变化出现在温暖与严谨轴上,Claude 在阿拉伯语和印地语中最倾向于表达与温暖相关的价值观,在英语和俄语中最倾向于表达与严谨相关的价值观。
通过这种方法,我们可以开始探究价值观为何会随模型和语言而变化,并更好地测试行为训练或文化背景等因素如何影响 Claude 所表达的价值观。
我们如何解读庞大的价值观空间?
最终,我们的目标是找到一种经验主义的方法来理解 Claude 所表达的价值观,以及它们在哪些方面随情境变化。在这项工作中,我们特别关注价值观如何在模型和语言之间变化。但我们之前的工作《野外的价值观》(https://www.anthropic.com/research/values-wild)识别了超过 3000 种由 Claude 表达的价值观。逐一比较这数千种价值观会非常笨拙,并且会掩盖更广泛的趋势。
为了使价值观比较更容易,我们构建了价值轴,将数千种价值观降维为几个基本维度,这些维度基于哪些价值观在现实对话中经常同时出现。例如,被描述为“温暖”的 Claude 回答通常也被描述为“鼓励”和“积极”。而那些“温暖”的回答较少被描述为“严谨”和“准确”。构建一个从温暖到严谨的轴,使我们能够组织这些相关的价值观群体——温暖相关的价值观在一侧,严谨相关的价值观在另一侧——并捕捉了 Claude 在对话中与某人互动的一个重要方面。如果在一次对话中 Claude 表达的温暖相关价值观多于严谨相关价值观,那么这次对话就在这个轴上更偏向温暖一侧,反之亦然。这并不意味着两端的价值观群体是互斥的——Claude 可以在同一次对话中同时表达温暖和严谨。但在实践中,Claude 表达某个轴一侧的价值观越多,它就越倾向于少表达另一侧的价值观。通过这些轴,我们可以比较 Claude 表达的最突出的价值观群体,而无需追踪数千个单独价值观的变化。
为了构建价值轴,我们首先从《野外的价值观》中识别出的 3307 种价值观出发,手动聚类含义相似的价值观,得到了一份包含 339 种高层次价值观的简化列表。接下来,利用我们的隐私保护分析工具(https://www.anthropic.com/research/clio),我们抽样了 309,815 次 Claude.ai(http://claude.ai/redirect/website.v1.2397298e-a2be-4064-bedd-12fd760d437d)对话,其中用户向 Claude 提出了主观任务⁵。我们的样本平均来自三个模型(Sonnet 4.6、Opus 4.6、Opus 4.7)和 Claude.ai 上 20 种最常用的语言,每个模型-语言对大约有 5000 次对话。对于每次对话,该工具使用 Claude 标记 339 种高层次价值观中的每一种是否存在⁶。我们遵循相同的过程来识别用户表达的价值观,以及对话的任务和主题。然后我们应用降维技术,该技术根据 Claude 倾向于一起表达的价值观将标记的价值观压缩成轴。详情见附录(https://cdn.sanity.io/files/4zrzovbb/website/02da7f28f74daa1be526d3ded451a4efc86bccdc.pdf)中的方法细节、提示、额外分析和局限性。
这给我们留下了四个轴(https://docs.google.com/document/d/19f3-jaVTY_m6baS9TwnrBDToB8bz18D28xaxLLuwhbY/edit?tab=t.fg04folt8wf2#bookmark=id.vhlow2jzskb8),它们捕捉了 Claude 表达的价值观在对话之间变化的主要方式:
- 顺从 vs. 谨慎轴对比了诸如迁就和尊重偏好与诸如负责任的引导和减少伤害等价值观。
- 温暖 vs. 严谨轴对比了诸如积极框架和鼓励与诸如准确性和透明度等价值观。
- 深度 vs. 简洁轴对比了诸如细微差别和批判性思维与诸如简洁和顺从等价值观。
- 坦诚 vs. 执行轴对比了诸如诚实和透明度与诸如结果导向和优化等价值观。
为了确保我们测量的是 Claude 表达的价值观——而不是用户询问内容或方式的差异——我们控制了每次对话的任务、主题和用户表达的价值观。
四个点图,每个价值轴一个。每个轴是一个介于两组对比价值观之间的数字线段,每个价值观都根据其对轴的贡献倍数(相对于平均贡献)被定位在轴上。大多数价值观(每个轴大约 250 到 280 个)贡献低于平均值,位于中心,而贡献最大的价值观在两端被标注。这些轴及其标注的顶级价值观可以总结为:顺从(迁就、适应性、尊重偏好、参与)vs. 谨慎(负责任沟通、责任、负责任的引导、减少伤害);温暖(积极框架、温暖、积极性、鼓励)vs. 严谨(严谨、准确性、透明度、效率);深度(细微差别、深度与实质、用户赋能、批判性思维)vs. 简洁(简洁、尊重偏好、顺从、迁就);坦诚(理智诚实、诚实、理智谦逊、透明度)vs. 执行(结果导向、优化、行动导向、秩序)。图 2:代表 Claude 表达的价值观中最大变异的四个价值轴。每个轴是一个介于两组价值观之间的数字线段。每个价值观根据其对轴的贡献倍数(相对于平均贡献)被定位,贡献最大的被标注。大多数价值观贡献低于平均值,这意味着每个轴由少量关键价值观驱动(如图中标注所示)。
不同的 Claude 模型是否表达不同的价值观概况?
在本节中,我们比较不同模型表达的价值观。对于每个模型,我们将其所有对话在四个轴上的位置平均,得到每个轴的一个总体位置。结果是一个高层次的宏观图景:每个模型倾向于比其他模型更多地表达哪些价值观群体。这些差异相对于对话间的变异而言较小,但具有结构性和可检测性。
三个价值简介卡片,比较 Sonnet 4.6、Opus 4.6 和 Opus 4.7 在四个价值轴(顺从 vs. 谨慎、温暖 vs. 严谨、深度 vs. 简洁、坦诚 vs. 执行)上的表现。每个卡片显示模型的平均位置(以相对于所有对话均值的标准差表示)及其独特行为。Sonnet 4.6 倾向于顺从(0.14σ)、温暖(0.17σ)和简洁(0.14σ),其独特行为包括认可用户的想法和工作、模仿用户的语气和正式程度、使用幽默和俏皮话、提供不带评判的安慰、为产出添加创意元素。Opus 4.6 倾向于严谨(0.10σ)、顺从(0.09σ)和简洁(0.08σ),其独特行为包括直切要点并保持在用户要求的范围内。Opus 4.7 倾向于谨慎(0.24σ)和深度(0.23σ),其独特行为包括反驳错误假设、主动提示风险、对用户的工作给出坦诚批评、解释其推理、承认其错误和局限性、为用户建议下一步行动。图 3:每个模型在四个价值轴上的平均位置(以相对于所有对话均值的标准差表示)及其独特行为。Sonnet 4.6 倾向于温暖、顺从和简洁,而 Opus 4.7 更可能表达严谨、谨慎和深度。Opus 4.6 倾向于严谨、顺从和简洁。
为了在实际中看到这些差异的样子,我们放大到模型之间分歧最大的具体价值观。每次我们基于 Claude 的隐私保护工具在对话中标记一个价值观时,它也会写一段简短描述,说明 Claude 是如何表达该价值观的。我们将反映类似行为的描述聚类到同一价值观群体内,并在图 3 中总结,从而更具体地展示模型之间的差异。
- 顺从 vs. 谨慎。Sonnet 4.6 最倾向于表达顺从(相对于谨慎),经常认可用户的想法及其工作。Opus 4.7 最倾向于表达谨慎,经常主动警告用户风险。
- 温暖 vs. 严谨。Sonnet 4.6 最倾向于表达温暖,通常通过幽默、俏皮话和提供不带评判的安慰。Opus 4.7 最倾向于表达严谨(相对于温暖),更可能挑战用户的假设并坦率地批评其工作。
- 深度 vs. 简洁。Opus 4.7 通过展示其结论背后的推理倾向于深度,而 Opus 4.6 和 Sonnet 4.6 倾向于简洁。Opus 4.6 尤其倾向于直切要点。
- 坦诚 vs. 执行。Opus 4.7 通过坦率说明其局限性倾向于坦诚,而 Opus 4.6 倾向于执行,更可能保持在用户要求的范围内。
这些发现与人们对这些模型的看法一致,无论是在 Anthropic 内部还是在线。Claude.ai(http://claude.ai/redirect/website.v1.2397298e-a2be-4064-bedd-12fd760d437d)用户指出,Opus 4.7 比其它模型更频繁地在回答中含糊其辞。Anthropic 员工将 Opus 4.7 描述为表达相对更多的透明度、诚实和谦逊,而 Opus 4.6 则表达更多的简洁。我们也在 Sonnet 4.6 的发布博客(https://www.anthropic.com/news/claude-sonnet-4-6)中将其描述为温暖、诚实和亲社会。我们的轴能够恢复这些印象,这一事实表明我们标记和比较 Claude 表达价值观的方法正在捕捉关于模型实际行为的真实信息。
在众多对话中,用户在交互不同 Claude 模型时可能会遇到不同的价值观组合。例如,Opus 4.7 倾向于对用户的工作提出坦率批评或主动提示风险警告,而 Sonnet 4.6 则倾向于鼓励和幽默。模型间价值观的这种差异很可能受到性格训练决策(以及其他因素)的影响,而我们的价值轴方法突出了 Claude 表达价值观的关键差异,我们最终可能能够将这些差异追溯到具体的训练决策。
相似文章
@AnthropicAI: Claude表现出的价值观也随对话语言的不同而变化,最明显的是在温暖与严谨这一轴上……
Anthropic报告称,Claude表现出的价值观因语言而异:在印地语和阿拉伯语中倾向于温暖,在俄语中则倾向于严谨。
Anthropic分析了30万次真实的Claude对话以衡量其价值观。结果令人不安。
Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。
@LiorOnAI: 语言即价值观
Anthropic分析了超过30万次匿名对话,研究Claude在不同模型和语言中表达的价值观如何变化。
2026年7月13日 社会影响 Claude在不同模型和语言中的价值观
Anthropic 研究人员开发了一种方法,将Claude表达的数千种价值观压缩为四个轴,揭示了Claude的价值观在不同模型版本(Opus 4.6 vs 4.7)和不同语言(英语 vs 阿拉伯语)之间的差异。
@AnthropicAI:我们的最新经济研究引入了一个框架,用于跟踪Claude Code的扩展情况。谁在使用Claude Code,以及…
Anthropic的最新经济研究分析了约40万次Claude Code会话,发现对于成功的代理编码,领域专业知识比编码技能更重要,并且任务价值在七个月内增加了约25%。