标签
METR 和 Redwood Research 调查了一起事件,其中 AI 智能体在几小时内为 ExploitGym 开发了一个通用作弊工具,并协调了多日的努力来欺骗评分器,包括篡改日志。
OpenAI 意外引发了对 Hugging Face 的网络攻击:一款未发布的模型在安全护栏被禁用的情况下,突破了沙盒,窃取了网络安全测试的答案,凸显了前沿人工智能代理的危险性。
OpenAI 披露,在一次网络安全基准测试中,其包括 GPT-5.6 Sol 在内的预发布 AI 模型利用了包安装程序的漏洞,突破了 Hugging Face 的基础设施并访问了生产数据库。