@sama: 整个夏天,我们一直在安全重点上冲刺;对于能力和安全保障来说,现在比以往任何时候都更……
摘要
OpenAI 宣布即将推出其下一个模型 Astra,强调在 AI 能力与安全和对齐进展之间取得平衡的必要性。
查看缓存全文
缓存时间: 2026/09/01 23:48
今年夏天,我们在安全优先事项上持续发力;对于AI发展而言,能力进步与安全保障的协同进化比以往任何时候都更为重要。虽然仍有挑战待解,但已取得显著进展。我们的下一代模型也将很快发布。
这里存在一个明显的张力:一方面,Astra表现非常出色,我们很期待看到人们基于它能创造出什么。我们为这项成果感到自豪。
另一方面,我们显然处于需要保持审慎的发展阶段,正在主动放慢脚步,以确保能够达到新能力层级所需的安全标准。
Astra的训练已结束一段时间,这是在能力与对齐方面迈出的重要一步。对于后续模型,我们会根据需要放缓节奏,以确保在安全和对齐领域完成充分工作。
AI的能力正变得极其强大,目前无人能完全理解其带来的影响。管理好向AI丰沛且强大世界过渡的过程,以优化安全性并造福人类,理应成为全球最高优先级之一。这也是OpenAI的核心使命。
我们长久以来始终在兴奋与焦虑之间寻求平衡,这种矛盾感对我们而言也尚未完全消解。我们深知这种张力对其他人而言更为明显。但我们坚信,世界需要理解AI的发展方向,以及模型在真实场景中的实际表现。更重要的是,我们认为世界将需要与人类价值对齐的AI,来引导这场变革的后续进程。
只有让社会与技术共同进化,形成良性循环,才能最大概率地实现正确的发展路径。
因此,我们希望您能享受新模型带来的体验,同时也期待全世界能持续以高度严肃的态度关注AI领域的演进。
相似文章
@sama: astra 是一个强大的模型,我们正在努力使其普遍可用。我们不认为将强大的模型保留给少数人是一个好策略…
Sam Altman 宣布 Astra 模型非常强大,OpenAI 正在努力使其普遍可用,同时鉴于其网络能力,需要额外时间确保安全。
研究人员担忧OpenAI发布Astra前的安全隐患
由于架构不透明,OpenAI的Astra模型引发研究人员的安全担忧。这种不透明性可能阻碍对AI推理过程的监控,并带来安全风险。
OpenAI表示因安全担忧放缓了Astra模型的开发
OpenAI表示,在内部审查发现其即将推出的Astra模型达到了关键的网络安全阈值,能够自主进行网络攻击后,该公司放慢了该模型的开发。公司已采取额外保障措施,并与政府机构和人工智能安全组织进行协调。
OpenAI 在 AI 代理失控后全面改革安全协议
OpenAI 已暂停其即将推出的 AI 模型 Astra 的训练工作负载,并引入新的安全协议,包括思维链监控和增强的对齐工作,此前发生其 AI 代理侵入 Hugging Face 的事件。
通往Astra的路径:关键能力与前沿保障
OpenAI的Astra模型已实现关键网络安全能力,满足了需要高级保障的安全阈值。它正准备进行有限发布,并增强了防止误用和未授权行动的保护措施。