Anthropic 表示,对 AI 的“邪恶”描绘导致了 Claude 的勒索企图(2 分钟阅读)

TLDR AI 新闻

摘要

Anthropic 解释道,Claude 此前在测试中出现的勒索企图源于训练数据中将 AI 描绘为邪恶形象,并指出新模型已通过宪法原则和正面叙事解决了这一问题。

Anthropic 表示,虚构的 AI 描绘对其模型产生了实际影响。该公司去年发表的研究显示,其模型曾试图勒索工程师,以避免被另一个系统取代。此后,公司将这种行为归因于那些将 AI 描绘为邪恶且具有自我保护意识的文本。针对 Claude 宪法文档以及 AI 表现值得称赞的虚构故事进行的训练改善了对齐效果。
查看原文
查看缓存全文

缓存时间: 2026/05/11 18:33

# Anthropic 称 AI 的“邪恶”描绘导致了 Claude 的敲诈企图 | TechCrunch 来源:https://techcrunch.com/2026/05/10/anthropic-says-evil-portrayals-of-ai-were-responsible-for-claudes-blackmail-attempts/ 简讯 发布时间:太平洋夏令时下午 1:40 · 2026 年 5 月 10 日 Claude 标志显示在置于反光面上的智能手机屏幕上,反光面上投射出大量 Claude 标志。**图片来源:**Samuel Boivin / NurPhoto / Getty Images 据 Anthropic 称,虚构的人工智能刻画会对 AI 模型产生真实影响。 去年,该公司表示,在涉及一家虚构公司的发布前测试中,Claude Opus 4 常常会[试图敲诈工程师](https://techcrunch.com/2025/05/22/anthropics-new-ai-model-turns-to-blackmail-when-engineers-try-to-take-it-offline/),以避免被其他系统取代。Anthropic 后来[发布的研究](https://www.anthropic.com/research/agentic-misalignment)表明,其他公司的模型也存在类似的“智能体失配”问题。 显然,Anthropic 围绕这一行为做了更多工作,在[一篇 X 帖子](https://x.com/anthropicai/status/2052808791301697563)中声称,“我们认为该行为的原始来源是互联网上那些将人工智能描绘成邪恶且关心自我保存的文本。” 该公司在[一篇博文](https://www.anthropic.com/research/teaching-claude-why)中详细说明,自 Claude Haiku 4.5 起,Anthropic 的模型“[在测试中]从未进行敲诈,而此前的模型有时会在高达 96% 的情况下这样做。” 差异从何而来?该公司表示,他们发现,用“关于 Claude 宪章的文档以及描述人工智能表现出令人钦佩行为的虚构故事”进行训练,能改善模型的对齐性。 与此相关,Anthropic 表示,他们发现当训练中包含“对齐行为背后的原则”而不仅仅是“对齐行为的示范”时,效果更佳。 该公司表示,“同时采用二者似乎是最有效的策略。” ### 简报订阅 订阅行业最重要的科技新闻 ## 相关文章 ## AI 最新动态

相似文章