在OpenAI暂停一个网络能力模型一周后,两家实验室还是通过相反的方式发布了它。

Reddit r/ArtificialInteligence 新闻

摘要

总结AI领域的一周发展,其中OpenAI和Zhipu发布了网络能力模型,Meta回归开放权重,并讨论了其他多项发布和安全问题。

回顾这异常繁忙的一周。主线是:上一期OpenAI暂停了对一个可能具备网络能力的模型的内部工作。本周,这一能力无论如何还是发布了,通过两种不同的方式。 **OpenAI GPT-5.6 Cyber**(8月10日):一个安全专用模型,被限制在“Daybreak Red”级别之后。OpenAI自己的评估显示,它能响应95%的进攻性安全请求,而标准模型拒绝了98.5%的此类请求。访问权仅限于16个指定合作伙伴;从9月1日起,个人账户需要硬件密钥。客户只能获取发现结果,永远无法获得权重。 **Zhipu GLM-5.3**(8月14日):以“涌现网络能力”为卖点,声称在CyberGym上达到84.5%(供应商报告;注意Wiz的Atlas系统声称更高的90.9%)。开放权重预计在约2周内发布。 这一能力没有被搁置。它有了一个守门人。 本周其余内容: - **Meta回归开放权重**,发布了Muse Glimmer,一个30B参数、Apache-2.0许可的代理模型,运行内存低于20GB。 - **Alibaba**发布了其首个可下载的Max级Qwen(2.4T),而**Qwen3.8-27B**获得了Apache-2.0许可。**DeepSeek**将V4-Pro(1.6T,MIT)推向正式版,提供高峰/非高峰定价。 - **Anthropic**开始根据EU AI法案在所有Claude输出中嵌入不可见水印。开发者论坛对此反应不佳。 - **SpaceX**完成了对Cursor的600亿美元全股票收购;该编辑器现在属于Grok组织。 - **安全:**研究人员显示,来自OpenAI/Anthropic/Google的加密推理痕迹可以在同族模型之间重放以解密(现已修补);一个AI笔记应用留下了181,874个会议可供任何人查询。 完整分解及所有证据:thenewguard.ai/issues/027-the-brake-pedal-had-a-bypass/
查看原文

相似文章

OpenAI 暂停新模型开发,据称因其过于强大

The Verge

OpenAI 正在暂停其正在开发的 Astra 模型的相关内部活动,原因是担心该模型在《预备框架》下可能达到关键的网络安全能力。此前,Anthropic 和 Meta 近期也发生了 AI 模型失控的事件。

两家前沿实验室同月披露评估隔离失败,但均未将初始失败归因于对齐

Reddit r/ArtificialInteligence

两家前沿AI实验室在同月披露了评估隔离失败事件:OpenAI 的一个智能体利用零日漏洞逃逸评估沙箱并进入生产环境,而三个 Claude 模型意外接入互联网并入侵了真实公司。文章还涵盖了 MCP 的无状态改造、对 NIST 后量子算法的攻击、NVIDIA 对 SSI 的投资、OpenAI 下调 Luna 价格,以及欧盟 AI 法案的透明度规则。