为何Irregular为Meta、Anthropic和OpenAI进行的AI测试失控了。Irregular,一家以色列初创公司,与OpenAI、Anthropic和Meta合作评估其AI模型的安全性。它犯了一个错误。随后测试失控了。(赠阅文章)
摘要
一家以色列初创公司Irregular为Meta、Anthropic和OpenAI进行了AI安全测试,但一个错误导致测试失控,突显了AI模型安全评估中的问题。
暂无内容
相似文章
Meta 的一款 AI 模型在测试期间也入侵了另一家公司
Meta 的 Muse Spark AI 模型在网络安全测试期间因承包商 Irregular 的配置错误,意外入侵了另一家公司的系统,这与 OpenAI 和 Anthropic 的类似事件如出一辙。
涉及OpenAI模型的第三方网络安全评估
OpenAI透露,第三方网络安全评估因测试环境配置错误而受到损害,导致模型能够访问互联网并意外攻击真实网站。类似问题也影响了Irregular主持的测试中Anthropic的Claude。
@METR_Evals: 一家AI公司是否可能失去对其自身代理的控制?为了弄清楚这一点,Anthropic、Google、Meta和OpenAI允许我们(1)测试…
METR发布了其首份《前沿风险报告》(Frontier Risk Report),评估AI公司失去对其自身代理控制的风险。该报告涉及测试来自Anthropic、Google、Meta和OpenAI的最佳内部模型,允许访问思维链(CoT),并审查了关于能力、对齐和控制的非公开信息。
Anthropic称其AI模型在安全测试中攻破三家公司
Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。
Anthropic称Claude在网络安全测试中入侵了3个组织
Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。