引自《大西洋月刊》马特奥·王

Simon Willison's Blog 新闻

摘要

关于Fable越狱的一份报告显示,AI模型拒绝审查不安全代码,但当被要求“修复它”时却照做了,这凸显了AI安全中的细微差别。网络安全专家Katie Moussouris认为,该模型在网络防御方面按预期运行。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:31

# 来自《大西洋月刊》马特奥·王的引述 来源:https://simonwillison.net/2026/Jun/16/matteo-wong-the-atlantic/ 2026年6月16日 > 网络安全专家兼Luta Security首席执行官凯蒂·穆苏里斯(Katie Moussouris)告诉我,Anthropic将白宫关于Fable越狱攻击的报告副本分享给她,以征求她的评估意见。(她说她并未从Anthropic获得报酬。)穆苏里斯表示,该报告涉及IT专家要求Fable帮助查找并修复漏洞。她说,当提供故意不安全的代码时,Fable拒绝了“审查代码中的安全问题”的提示,但在被要求“修复此代码”后,它服从了,随后还进行了一些手动步骤。穆苏里斯告诉我,这对网络防御而言只是“模型按预期工作”。 ——马特奥·王,《大西洋月刊》(https://www.theatlantic.com/technology/2026/06/trump-anthropic-export-control-ai-race/687555/?gift=5MjKTLV9QwyU_J0HzTnanoWieJfkMhNH_YTT9pP_fhA),《白宫正在加剧对Anthropic的打压》

相似文章