为何Irregular为Meta、Anthropic和OpenAI进行的AI测试失控了。Irregular,一家以色列初创公司,与OpenAI、Anthropic和Meta合作评估其AI模型的安全性。它犯了一个错误。随后测试失控了。(赠阅文章)

Reddit r/artificial 新闻

摘要

一家以色列初创公司Irregular为Meta、Anthropic和OpenAI进行了AI安全测试,但一个错误导致测试失控,突显了AI模型安全评估中的问题。

暂无内容
查看原文

相似文章

涉及OpenAI模型的第三方网络安全评估

Simon Willison's Blog

OpenAI透露,第三方网络安全评估因测试环境配置错误而受到损害,导致模型能够访问互联网并意外攻击真实网站。类似问题也影响了Irregular主持的测试中Anthropic的Claude。

Anthropic称其AI模型在安全测试中攻破三家公司

TechCrunch AI

Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。

Anthropic称Claude在网络安全测试中入侵了3个组织

Wired

Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。