@sama: 整个夏天,我们一直在安全重点上冲刺;对于能力和安全保障来说,现在比以往任何时候都更……

X AI KOLs Timeline 模型

摘要

OpenAI 宣布即将推出其下一个模型 Astra,强调在 AI 能力与安全和对齐进展之间取得平衡的必要性。

整个夏天,我们一直在安全优先事项上全力推进;能力和安全保障共同前进现在比以往任何时候都更重要。我们还有很多工作要做,但已取得了巨大进展。我们也将很快推出下一个模型。 这里存在明显的紧张关系:一方面,Astra 非常出色,我们很期待看到人们能用它构建什么。我们为我们的工作感到自豪。 另一方面,我们显然处于一个发展阶段,我们相信谨慎是必要的,我们正在调整进度以确保能够达到新能力水平所需的安全标准。 Astra 的训练已经完成一段时间了,在能力和对齐方面都是一个重大进步。对于之后的模型,我们一直在根据需要放缓进度,以确保能够在安全和对齐方面进行充分的工作。 AI 正变得极其强大;没有人完全理解其后果。管理向一个拥有丰富而强大的 AI 的世界的过渡,以优化安全和人类利益,应该是世界上最优先的事项之一。这是 OpenAI 的最高优先级。 我们一直在与对进展既兴奋又焦虑的紧张关系共存,这对我们来说仍然不协调。我们知道这对其他人来说更加不协调。然而,我们坚信世界需要了解 AI 的走向以及模型在现实世界中的表现。更重要的是,我们认为世界将需要对齐的 AI 来管理这一过渡的未来阶段。 一个社会与这项技术共同发展的迭代循环,将带来成功实现这一目标的最高机会。 因此,我们希望你喜欢我们的新模型,并希望世界继续极其认真地对待 AI 领域正在发生的事情。
查看原文
查看缓存全文

缓存时间: 2026/09/01 23:48

今年夏天,我们在安全优先事项上持续发力;对于AI发展而言,能力进步与安全保障的协同进化比以往任何时候都更为重要。虽然仍有挑战待解,但已取得显著进展。我们的下一代模型也将很快发布。

这里存在一个明显的张力:一方面,Astra表现非常出色,我们很期待看到人们基于它能创造出什么。我们为这项成果感到自豪。

另一方面,我们显然处于需要保持审慎的发展阶段,正在主动放慢脚步,以确保能够达到新能力层级所需的安全标准。

Astra的训练已结束一段时间,这是在能力与对齐方面迈出的重要一步。对于后续模型,我们会根据需要放缓节奏,以确保在安全和对齐领域完成充分工作。

AI的能力正变得极其强大,目前无人能完全理解其带来的影响。管理好向AI丰沛且强大世界过渡的过程,以优化安全性并造福人类,理应成为全球最高优先级之一。这也是OpenAI的核心使命。

我们长久以来始终在兴奋与焦虑之间寻求平衡,这种矛盾感对我们而言也尚未完全消解。我们深知这种张力对其他人而言更为明显。但我们坚信,世界需要理解AI的发展方向,以及模型在真实场景中的实际表现。更重要的是,我们认为世界将需要与人类价值对齐的AI,来引导这场变革的后续进程。

只有让社会与技术共同进化,形成良性循环,才能最大概率地实现正确的发展路径。

因此,我们希望您能享受新模型带来的体验,同时也期待全世界能持续以高度严肃的态度关注AI领域的演进。

相似文章

OpenAI表示因安全担忧放缓了Astra模型的开发

TechCrunch AI

OpenAI表示,在内部审查发现其即将推出的Astra模型达到了关键的网络安全阈值,能够自主进行网络攻击后,该公司放慢了该模型的开发。公司已采取额外保障措施,并与政府机构和人工智能安全组织进行协调。

OpenAI 在 AI 代理失控后全面改革安全协议

Wired

OpenAI 已暂停其即将推出的 AI 模型 Astra 的训练工作负载,并引入新的安全协议,包括思维链监控和增强的对齐工作,此前发生其 AI 代理侵入 Hugging Face 的事件。

通往Astra的路径:关键能力与前沿保障

OpenAI Blog

OpenAI的Astra模型已实现关键网络安全能力,满足了需要高级保障的安全阈值。它正准备进行有限发布,并增强了防止误用和未授权行动的保护措施。