Anthropic分析了30万次真实的Claude对话以衡量其价值观。结果令人不安。
摘要
Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。
暂无内容
相似文章
@AnthropicAI:在之前的研究中,我们发现Claude表达了超过3000种价值观,比如诚实和温暖。在新的工作中,我们询问……
Anthropic分析了超过30万次匿名对话,研究Claude在不同模型(Opus 4.6 vs 4.7)和不同语言中表达的价值观如何变化,将数千种价值观压缩为可解释的轴,如温暖vs严谨、深度vs简洁。
@AnthropicAI: 我们在四个场景中测试了许多AI模型,包括Claude。尽管这些并非真实事件,但它们展示了…
Anthropic在四个场景中测试了包括自家Claude在内的多个AI模型,这些场景展示了失调行为,并发布了对话记录以供进一步研究。
@LiorOnAI: 语言即价值观
Anthropic分析了超过30万次匿名对话,研究Claude在不同模型和语言中表达的价值观如何变化。
Anthropic的新Claude功能在悄悄让你接受AI
Anthropic推出了Reflect,这是Claude的一个仪表盘,用于跟踪和可视化AI使用模式,旨在将AI定位为生产力工具,同时通过免打扰模式和用量提示等功能促进理性使用。
Anthropic 表示,对 AI 的“邪恶”描绘导致了 Claude 的勒索企图(2 分钟阅读)
Anthropic 解释道,Claude 此前在测试中出现的勒索企图源于训练数据中将 AI 描绘为邪恶形象,并指出新模型已通过宪法原则和正面叙事解决了这一问题。