Anthropic撤回了一项可能‘阻挠’使用Claude的AI研究人员的政策

Wired 新闻

摘要

Anthropic撤销了一项有争议的政策,该政策原本会秘密降低Claude Fable 5对试图构建竞争性AI模型的研究人员的性能表现,此举是在AI研究社区强烈反对之后做出的。

该公司在研究人员公开反对该政策后改变了方向,该政策原本会暗中限制Claude开发竞争性AI模型的能力。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:44

# Anthropic 收回可能“暗中破坏”使用 Claude 的 AI 研究人员的政策 来源:https://www.wired.com/story/anthropic-responds-to-backlash-on-claudes-secret-sabotage-on-ai-research/ Anthropic 正在撤回一项政策,该政策原本会暗中限制竞争对手利用其新 AI 模型 Claude Fable 5 (https://www.wired.com/story/anthropic-releases-claude-fable-5-mythos-5/) 开发其他 AI 模型。在遭到 AI 研究社区 (https://www.wired.com/tag/artificial-intelligence/) 的强烈反对后,该公司改变了方向。 “我们将修改 Fable 5 针对前沿大语言模型开发的安全措施,使其可见。”Anthropic 在给 WIRED 的一份声明中表示,“我们做出了错误的权衡,并为未能把握好平衡而道歉。” 本周早些时候,Anthropic 发布了 Claude Fable 5,这是其最新 AI 模型的一个版本,配备了额外的安全护栏,旨在防止滥用。Anthropic 决定的部分安全措施并不令人意外:该公司表示,对于询问网络安全、生物学或化学问题的用户,系统将将其引导至能力较弱的 AI 模型,以减少有人利用高级 AI 发动网络攻击或制造生物武器的可能性。 但对于那些试图将 Claude Fable 5 用于前沿 AI 开发的研究人员,Anthropic 制定了不同的方法。该公司会故意降低模型的表现,而用户对此一无所知。这一举措实际上是在暗中破坏那些试图使用 Claude 训练竞争性 AI 模型的研究人员——Anthropic 在其服务条款 (https://www.anthropic.com/legal/consumer-terms) 中明确禁止这种行为。 Anthropic 现在表示将改变方向,Claude Fable 5 关于 AI 开发的安全措施将对用户可见。如果该公司怀疑用户试图利用 Claude 构建高性能 AI,它将提醒用户:要么拒绝请求,要么将用户引导至能力较弱的模型。 Anthropic 在遭到 AI 研究社区的强烈批评后收回了这一政策。此前,Anthropic 已采取措施限制竞争对手使用 Claude (https://www.wired.com/story/anthropic-revokes-openais-access-to-claude/) 构建闭源和开源 AI 模型,但批评者认为,悄悄降低特定用户模型性能的做法走得太远了。Claude 的编程代理已成为开发者(包括那些从事开源 AI 研究项目的开发者)青睐的工具。研究人员告诉 WIRED,该公司的最新政策可能导致一个令人担忧的未来:只有少数领先的 AI 实验室能够进行高级 AI 研究。 美国创新基金会高级研究员、前白宫 AI 顾问 Dean Ball 在 X 平台的一篇帖子 (https://x.com/deanwball/status/2064434861088395730?s=20) 中写道:“*在未告知用户的情况下*降低机器学习研究的性能,这是令人震惊的敌意行为,形象极差。”他在另一篇帖子 (https://x.com/deanwball/status/2064665679307985244?s=20) 中继续说道,这种“秘密破坏”政策损害了 Anthropic 的整体立场,因为它限制了 AI 研究人员在 AI 安全方面进行合作。 “感觉 Anthropic 在对公众说:‘我们不信任其他人从事 AI 研究。我们是唯一有资格做 AI 研究的人。’”开源 AI 初创公司 Prime Intellect 的研究主管 Will Brown 表示,“这感觉有点像他们开始把梯子抽走。” Brown 表示,这项政策还会让开发者不清楚自己是否违反了 Anthropic 的规定,因为该公司在安全措施被触发时不会通知他们。他补充说,这些限制可能产生广泛的后果。例如,他提到了日益增长的第三方评估机构生态系统,这些机构负责测试前沿模型的安全性、性能和可靠性——如果 Anthropic 秘密降低模型性能,这些工作可能会受到阻碍。

相似文章