@claudeai:我们正在更新Claude Fable 5的生物学安全防护措施,以减少误报。在我们的测试中,此更新减少了生物…

X AI KOLs Timeline 模型

摘要

Anthropic正在更新Claude Fable 5的生物学安全防护措施,以减少误报,将生物学相关的回退减少了约85%,同时仍限制病毒学、分子设计等双重用途能力。

我们正在更新Claude Fable 5的生物学安全防护措施,以减少误报。在我们的测试中,此更新将我们各产品端的生物学相关回退减少了约85%。 现在,Fable可以在更广泛的日常健康和教育问题上提供帮助。 我们相信,AI最大的积极影响将出现在生物学和医学领域,我们致力于将前沿智能安全地交到尽可能多的研究人员手中。对于我们认为具有双重用途的请求(包括病毒学、毒理学和分子设计),Fable将继续回退到Opus 5,因此它尚不能用于专业的生物学研究和药物开发。 我们致力于通过可信的访问途径来缩小这一差距,以提供前沿生物学能力。
查看原文
查看缓存全文

缓存时间: 2026/08/07 04:47

我们正在更新 Claude Fable 5 的生物学安全防护,以减少误报。在我们的测试中,此更新使各产品界面上与生物学相关的回退减少了约 85%。

Fable 现在可以协助解答更广泛的日常健康和教学问题。

我们相信,AI 的最大积极影响将出现在生物学和医学领域,并且我们致力于将前沿智能安全地交到尽可能多的研究人员手中。对于我们认为属于双重用途的请求——包括病毒学、毒理学和分子设计——Fable 将继续回退到 Opus 5,因此它尚不能用于专业生物学研究和药物开发。

我们致力于通过可信访问途径来弥合这一差距,以提供前沿生物学能力。


改进 Fable 5 的安全防护

Source: https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards 我们正在对 Claude Fable 5 的生物学安全防护进行更新,以大幅减少误报。Fable 5 用户现在会体验到更少的“回退”——即当用户提出与生物学相关的查询后,系统切换到能力较弱的模型。在我们的测试中,这一更新使各产品界面上与生物学相关的回退减少了约 85%。1

因此,Fable 5 将能够协助处理更广泛的生物学任务。

在实践中,用户在常见的健康和教学问题上看到的回退会大大减少——例如,解读化验结果、理解症状,以及在教育情境中学习生物学。医疗专业人员将能在临床任务上从 Fable 5 获得更多支持。

我们相信,AI 对世界产生积极影响的最大机会在于生物学和医学,我们正在大力投资,以负责任的方式为生物学家提供前沿访问权限。如今,对于我们认为属于双重用途的请求——包括病毒学、毒理学和分子设计——Fable 仍会回退到 Opus 5,因此它尚不能用于专业生物学研究和药物开发。我们致力于通过可信访问途径来弥合这一差距,以提供前沿生物学能力。

我们为何建立强大的生物学安全防护

我们的目标是把 Fable 5 的前沿能力尽可能快速、广泛地带给用户。然而,要做到这一点,我们需要管理这类高能力模型所带来的日益增长的风险。其中一项风险就出现在生物学领域:Fable 5 如今在一些高度复杂的生物学任务上可以超越专家,并在其他任务上提供操作支持。这意味着,它可以为正在开发新治疗手段的研究人员提供真正的帮助(这也是我们如此热衷于通过分类器改进和可信访问计划来扩大模型访问范围的原因)。但如果落入不当之手,同样的能力也可能被恶意行为者利用,例如用于开发生物武器。我们的能力评估显示,Fable 5 可能为这类行为者带来显著的提升——也就是说,它能提供他们在其他任何地方都无法获得的能力。

在生物学领域,区分 AI 的有益用途和有害用途往往很困难。例如,在某些情况下,研究某种疾病的治疗方法需要科学家首先生产出导致该疾病的危险化合物。这在活疫苗中最为明显,因为科学家需要培养他们旨在预防的同一病原体。某些药物也是如此。为了开发治疗高血压的药物卡托普利,科学家从蛇毒中分离出了能使人血压骤降的毒性成分。随着 AI 前沿不断涌现新的生物学能力,我们需要保持谨慎,确保它们带来的新风险不会先于其潜在科学利益而成为现实。

那些希望利用我们的模型作恶的复杂行为者知道如何利用这种模糊性来掩盖其意图,让危险任务看起来像普通的研究工作。美国情报界《2026年度威胁评估》明确指出,此类行为者确实存在,并且生物技术的进步(包括合成生物学和基因组编辑)“可能导致新型生物威胁”。报告还指出,一些国家行为者很可能维持着活跃的进攻性生物和化学武器计划——这些计划可能因获取前沿AI模型的原始能力而加速推进。

由于我们对这些“双重用途”能力(即既可用于有益目的也可能用于有害目的,且二者的界限并不总是容易划清)的担忧,我们有意让 Fable 5 在发布时屏蔽了几乎所有生物学查询。这使我们能够将模型提供给其他领域的用户使用。我们清楚这会让合法生物学用户感到沮丧:短期内会导致大量误报——用户提出生物学相关问题会被拦截并转交给能力较弱的模型。尽管如此,我们还是选择了这样的取舍,因为在生物学这类双重用途领域,Fable 被滥用的代价可能是灾难性的

我们的生物学安全防护如何运作

我们防范生物学领域滥用的核心方式之一是通过安全分类器——较小型的自动化AI系统,用于检测Fable 5是否被要求执行受保护的生物学任务,或是否会产生有害输出(我们此前已撰写过有关网络安全领域类似分类器的文章)。

就 Fable 5 而言,当分类器触发时,模型会将用户的请求重新路由到 Opus 5——这是一个能力较强的模型,但其生物学能力不如 Fable 5,也无法为恶意用户提供同样多的帮助。这就是用户请求被拦截时看到的回退。

开发精确、稳健的分类器并非一项简单的任务。分类器要想快速且一致地工作,就必须学会区分我们认为“在范围内”和“范围外”的潜在有害主题和查询。调整分类器需要时间和反复迭代,以避免误报(分类器对范围外内容触发)和漏报(漏掉范围内内容)。我们还要求分类器能够抵御绕过它们的尝试(即“越狱”),这需要更深入的研究和测试。

最初采用非常宽泛的生物学分类器,意味着我们可以在继续研究并改进分类器的同时,让用户使用 Fable 5。另一种选择——等安全防护取得更大进展后再发布模型——会将该模型的普遍可用性及其对用户的潜在益处推迟数周甚至数月。

在过去的几周里,我们仔细重写了分类器的准则(由一组规则组成,帮助模型区分受保护内容和允许内容),并特意对良性用途做了详细豁免。我们就这些更改征求了多位专家(包括 Anthropic 内部和外部)的反馈。随后,我们基于该准则为分类器开发了更新的训练数据,并对其进行了重新训练,同时验证了新的分类器仍会对有害及双重用途的研究性生物学内容触发,但如今会允许更广泛的良性且有益的用法。

如下图所示,这些更新意味着——与 Fable 5 发布时相比——分类器对良性生物学相关请求的触发次数将大幅减少。

我们的生物学分类器示意图。落在分类器边界左侧的内容被允许;落在右侧的内容受保护(因此会被拦截并转交给能力较弱的模型)。明显有害的内容(红色)以及双重用途的内容(橙色)会触发分类器并被拦截。我们设有一个安全边际,包含极可能良性但仍因充分谨慎而被拦截的内容(浅绿色)。明显良性的内容为深绿色。 Fable 5 发布时采用了非常宽泛的分类器(A),会在大量请求上触发——即使是几乎肯定良性的请求(即安全边际内的内容)。因此,分类器边界位于图中非常靠左的位置。我们今天宣布的更新(B)意味着分类器会允许更多良性请求,因为它能更好地辨别良性查询与双重用途查询之间的细微差别。因此,图中的分类器边界进一步向右移动。

结论

要完善我们的安全防护,仍有大量工作要做。误报将不可避免地继续存在——即请求落在分类器的安全边际内,风险极低但分类器仍会触发。正如我们上面提到的,由于潜在的双重用途风险,Fable 将继续拦截双重用途的专业生物学和药物开发查询。我们完全致力于开发一条安全、可扩展的路径,让研究人员通过可信访问途径使用我们最强大的模型。

我们希望您继续向我们分享反馈,以便我们进一步改进安全防护。

脚注

1因此,我们预计回退总量——无论是生物学相关还是其他原因——也将减少:在 Claude.ai 上约为 67%,在 Cowork 上约为 55%,在 Claude Code 上约为 17%,在 Claude Platform 上约为 7%。

相关内容

Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic 担任首席全球事务官

Mariano-Florentino (Tino) Cuéllar 将以首位首席全球事务官的身份加入 Anthropic。

阅读更多

调查我们网络安全评估中的三起真实世界事件

阅读更多

相似文章

Claude Fable 无法回答基础生物学问题

The Verge

Anthropic 新发布的 Claude Fable 5 模型因过于保守的安全过滤器拒绝回答基础生物学问题,这些过滤器旨在防止生物武器滥用,凸显了能力与安全性之间的权衡。