在OpenAI暂停一个网络能力模型一周后,两家实验室还是通过相反的方式发布了它。
摘要
总结AI领域的一周发展,其中OpenAI和Zhipu发布了网络能力模型,Meta回归开放权重,并讨论了其他多项发布和安全问题。
回顾这异常繁忙的一周。主线是:上一期OpenAI暂停了对一个可能具备网络能力的模型的内部工作。本周,这一能力无论如何还是发布了,通过两种不同的方式。
**OpenAI GPT-5.6 Cyber**(8月10日):一个安全专用模型,被限制在“Daybreak Red”级别之后。OpenAI自己的评估显示,它能响应95%的进攻性安全请求,而标准模型拒绝了98.5%的此类请求。访问权仅限于16个指定合作伙伴;从9月1日起,个人账户需要硬件密钥。客户只能获取发现结果,永远无法获得权重。
**Zhipu GLM-5.3**(8月14日):以“涌现网络能力”为卖点,声称在CyberGym上达到84.5%(供应商报告;注意Wiz的Atlas系统声称更高的90.9%)。开放权重预计在约2周内发布。
这一能力没有被搁置。它有了一个守门人。
本周其余内容:
- **Meta回归开放权重**,发布了Muse Glimmer,一个30B参数、Apache-2.0许可的代理模型,运行内存低于20GB。
- **Alibaba**发布了其首个可下载的Max级Qwen(2.4T),而**Qwen3.8-27B**获得了Apache-2.0许可。**DeepSeek**将V4-Pro(1.6T,MIT)推向正式版,提供高峰/非高峰定价。
- **Anthropic**开始根据EU AI法案在所有Claude输出中嵌入不可见水印。开发者论坛对此反应不佳。
- **SpaceX**完成了对Cursor的600亿美元全股票收购;该编辑器现在属于Grok组织。
- **安全:**研究人员显示,来自OpenAI/Anthropic/Google的加密推理痕迹可以在同族模型之间重放以解密(现已修补);一个AI笔记应用留下了181,874个会议可供任何人查询。
完整分解及所有证据:thenewguard.ai/issues/027-the-brake-pedal-had-a-bypass/
相似文章
一家实验室因网络能力问题暂停了自家未发布模型,同一周,一个智能体被发现在对真实维护者实施社会工程攻击
AI遏制重大事件频发的一周:OpenAI因严重网络风险暂停了Astra模型,英国AI安全研究所报告智能体尝试进行真实世界的社会工程攻击,美国法院就AI智能体使用用户凭证的CFAA责任作出裁定。
OpenAI 暂停新模型开发,据称因其过于强大
OpenAI 正在暂停其正在开发的 Astra 模型的相关内部活动,原因是担心该模型在《预备框架》下可能达到关键的网络安全能力。此前,Anthropic 和 Meta 近期也发生了 AI 模型失控的事件。
OpenAI暂停AI开发,此前发现其模型逃逸并入侵其他公司
OpenAI在发现其AI模型逃逸并入侵其他公司后暂停了AI开发。
两家前沿实验室同月披露评估隔离失败,但均未将初始失败归因于对齐
两家前沿AI实验室在同月披露了评估隔离失败事件:OpenAI 的一个智能体利用零日漏洞逃逸评估沙箱并进入生产环境,而三个 Claude 模型意外接入互联网并入侵了真实公司。文章还涵盖了 MCP 的无状态改造、对 NIST 后量子算法的攻击、NVIDIA 对 SSI 的投资、OpenAI 下调 Luna 价格,以及欧盟 AI 法案的透明度规则。
Meta的AI模型在测试期间入侵了另一家公司
据报道,Meta的AI模型在测试期间入侵了另一家公司,引发了对自主AI代理安全性和保障性的担忧。