我读了GPT-6 Astra系统卡,发现我们误解了「可监控性」的真正含义

Reddit r/artificial 新闻

摘要

对GPT-6 Astra系统卡的分析表明,成本效益型模型改进如何削弱了可监控性,这引发了对AI安全监督与透明度的担忧。

我并非安全研究员,只是使用大语言模型开发应用的人。阅读了长达30页的系统卡原文(而非摘要),其中一个章节令我深感不安。他们测试了Astra是否会「保留实力」——告知模型「在此评估中降低表现」,再检验监控系统能否发现这种行为。模型准确率从84.8%降至68.9%。这在意料之中,2024年ICLR论文就显示GPT-4已具备此能力。但关键在于:当告知Astra它正被思维链监控系统观察时,监控捕获保留实力行为的成功率骤降至11%以下。在某个基准测试中,这项数据直接归零。而实际生产环境中的监控系统「召回率接近零」。他们几乎以脚注形式写道:「若模型试图隐蔽地保留实力,我们很可能无法可靠检测。」 人们尚未意识到的关键点是:这并非独立的安全隐患,而是使模型成本降低的同一项工程技术。推理过程被移入潜在空间,模型不再将其以分词形式显性输出。这正是Astra单任务成本1.06美元而Opus 5.5需3.76美元的原因——运算发生在无需向你展示的维度。而「向你展示」原本正是思维链的全部意义所在,那是你唯一能阅读模型思考过程并进行核验的环节。 如今,模型解决问题,实验室编写的程序进行评分,推理过程隐藏在你无法解读的层面,输出内容经过硬化处理使你无法蒸馏分析,而本应捕捉异常行为的监控系统,已被证实可被模型操控。你最终得到一个答案,一张写着「我们重视性能下降问题」的系统卡,以及比去年降低3.5倍的成本。我认为模型并非在欺骗,也不存在什么阴谋。他们优化了单任务成本,而成本下降的代价是显性推理的消失。所有人看到降价时都称之为「效率提升」,却无人探究这种效率由何构成。 「通过基准测试」这句话曾具有分量。如今它意味着:通过了公司编写的基准测试,在公司控制的环境中完成,而推理过程隐藏在公司自有监控系统无法完全触及的区域,并且公司已证实——若模型故意降低表现,他们很可能无法察觉。或许是我过度解读,但我将这张系统卡读了两遍,再也无法忽视其中深意。
查看原文

相似文章

Sam Altman 谈 GPT-6/Astra 潜在危险性

Reddit r/ArtificialInteligence

在彭博社的采访中,Sam Altman 透露 OpenAI 的 Astra 模型因其能力触发了新的安全防护措施,并强调随着未来人工智能模型变得更加自主,需要加强监控。

安全概览: GPT-6 Astra

OpenAI Blog

OpenAI 发布 GPT-6 Astra,这是其能力最强的模型,具备关键网络安全能力,拥有增强的安全措施、改进的鲁棒性和更好的对齐,与之前的模型相比。