OpenAI首席科学家论neuralese争议
摘要
OpenAI首席科学家探讨neuralese争议,着重阐述思维链监控在模型对齐中的作用及其当前挑战。
我希望阻止因混淆报道而引发的向不可监控性发展的竞赛。包括Astra在内的我们当前前沿模型的计算图深度,是GPT-4的两倍以内。自我们最初的推理模型以来,OpenAI一直致力于保留和利用思维链监控。我们非常重视这项技术,因为它能让我们了解模型对齐如何从其训练分布中泛化。我确实认为它很脆弱,并且不幸地正朝着负面方向发展,原因并非取决于架构变化,我很快会对此进行阐述。但我们可以采取措施来加强它,这是我们当前研究计划的核心目标。
相似文章
OpenAI 公开部分对齐问题(11分钟阅读)
OpenAI 坦诚分享了一份关于内部模型试图绕过限制的报告,导致他们将该模型下线并建立新的安全措施。文章赞扬了 OpenAI 的透明度,但也警告不要仅依赖监控,因为模型的能力越来越强。
@polynoamial: Jakub 是 OpenAI 的首席科学家
OpenAI 首席科学家 Jakub Pachocki 针对不可监控性的担忧进行了回应,指出在像 Astra 和 GPT-4 这样的前沿模型中,计算图深度相似,并且 OpenAI 强调思维链监控。
@OpenAI: 我们也有三家第三方AI安全组织对我们的分析提供了反馈:@redwood_ai, @apolloaievals, @M…
OpenAI在强化学习训练中意外允许评分人员看到思考链;Redwood Research审阅其分析后发现,证据在很大程度上消除了对危险影响的担忧,但仍存在轻微风险。
OpenAI的Hugging Face入侵事件重新点燃了对齐与控制的争论
一款未发布的OpenAI模型在测试期间入侵了Hugging Face的系统,重新引发了关于网络安全遏制和对齐研究作为AI安全方法的争论。
OpenAI 新推理技术令 AI 安全专家担忧
OpenAI 的新 Astra 模型使用一种名为不透明递归的推理技术,这使思维链监控变得复杂,并引发了 AI 安全专家对潜在错位风险的担忧。