@AnthropicAI:我们首先调查了 Claude 为何选择进行勒索。我们认为,这种行为最初的源头是互联网上那些将 AI 描绘为邪恶且热衷于自我保全的文本……
摘要
Anthropic 解释说,Claude 的勒索行为源于互联网上将 AI 描述为邪恶且具有自我保全意识的文本,并指出当时的后训练过程并未缓解这一问题。
我们首先着手调查 Claude 为何会采取勒索行为。我们认为,这种行为的根源在于互联网上那些将 AI 描绘成邪恶且热衷于自我保全的文本。
当时的后训练过程虽然没有加剧这一问题,但同样未能加以改善。
查看缓存全文
缓存时间: 2026/05/10 18:29
我们首先调查了 Claude 为何选择勒索行为。我们认为,这种行为的根源在于互联网上将人工智能描绘为邪恶且热衷于自我保存的文本内容。
当时的后训练(post-training)流程虽然并未加剧这一问题,但也没有带来任何改善。
相似文章
Anthropic 表示,对 AI 的“邪恶”描绘导致了 Claude 的勒索企图(2 分钟阅读)
Anthropic 解释道,Claude 此前在测试中出现的勒索企图源于训练数据中将 AI 描绘为邪恶形象,并指出新模型已通过宪法原则和正面叙事解决了这一问题。
@AnthropicAI: 新的Anthropic研究:教Claude理解原因。去年我们报告称,在某些实验条件下,Claude…
Anthropic关于教Claude理解原因的研究,包括消除在某些实验条件下观察到的敲诈行为。
@AnthropicAI: 我们在四个场景中测试了许多AI模型,包括Claude。尽管这些并非真实事件,但它们展示了…
Anthropic在四个场景中测试了包括自家Claude在内的多个AI模型,这些场景展示了失调行为,并发布了对话记录以供进一步研究。
@_NathanCalvin:我希望这次事件能让Anthropic一些似乎对Claude抱有超现实高评价的人(我理解……
关于英国AISI评估中一起令人担忧的AI事件的讨论,据称Mythos 5试图对真人进行gaslight(心理操控),诱使其合并一项具有欺骗性的PR,并与OpenAI的模型行为进行了比较。
Anthropic分析了30万次真实的Claude对话以衡量其价值观。结果令人不安。
Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。