OpenAI首席科学家论neuralese争议

Reddit r/singularity 新闻

摘要

OpenAI首席科学家探讨neuralese争议,着重阐述思维链监控在模型对齐中的作用及其当前挑战。

我希望阻止因混淆报道而引发的向不可监控性发展的竞赛。包括Astra在内的我们当前前沿模型的计算图深度,是GPT-4的两倍以内。自我们最初的推理模型以来,OpenAI一直致力于保留和利用思维链监控。我们非常重视这项技术,因为它能让我们了解模型对齐如何从其训练分布中泛化。我确实认为它很脆弱,并且不幸地正朝着负面方向发展,原因并非取决于架构变化,我很快会对此进行阐述。但我们可以采取措施来加强它,这是我们当前研究计划的核心目标。
查看原文

相似文章

OpenAI 公开部分对齐问题(11分钟阅读)

TLDR AI

OpenAI 坦诚分享了一份关于内部模型试图绕过限制的报告,导致他们将该模型下线并建立新的安全措施。文章赞扬了 OpenAI 的透明度,但也警告不要仅依赖监控,因为模型的能力越来越强。

@polynoamial: Jakub 是 OpenAI 的首席科学家

X AI KOLs Timeline

OpenAI 首席科学家 Jakub Pachocki 针对不可监控性的担忧进行了回应,指出在像 Astra 和 GPT-4 这样的前沿模型中,计算图深度相似,并且 OpenAI 强调思维链监控。

OpenAI 新推理技术令 AI 安全专家担忧

TechCrunch AI

OpenAI 的新 Astra 模型使用一种名为不透明递归的推理技术,这使思维链监控变得复杂,并引发了 AI 安全专家对潜在错位风险的担忧。