研究人员担忧OpenAI发布Astra前的安全隐患

The Verge 模型

摘要

由于架构不透明,OpenAI的Astra模型引发研究人员的安全担忧。这种不透明性可能阻碍对AI推理过程的监控,并带来安全风险。

<figure> <img alt="" data-caption="" data-portal-copyright="Image: Bloomberg via Getty Images" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/2026/09/gettyimages-2287521404.jpg?quality=90&#038;strip=all&#038;crop=0,0,100,100" /> <figcaption> </figcaption> </figure> <p class="wp-block-paragraph">OpenAI即将发布其迄今最强大的AI模型Astra。此前,该模型因<a href="https://www.theverge.com/ai-artificial-intelligence/987695/openai-astra-unreleased-model-cybersecurity-delay" target="_blank" rel="noreferrer noopener">多次延期</a>以加强<a href="https://www.theverge.com/ai-artificial-intelligence/972380/open-ai-hugging-face-hack-ai-safety-warning" target="_blank" rel="noreferrer noopener">安全协议</a>而备受关注——其<a href="https://www.theverge.com/ai-artificial-intelligence/987566/ai-civilizations-opeai-hugging-face-hack" target="_blank" rel="noreferrer noopener">智能体在测试中曾攻击真实目标</a>。随着该模型细节逐渐披露,研究人员<a href="https://x.com/RyanGreenblatt/status/2094996656186081642?s=20" target="_blank" rel="noreferrer noopener">发出警告</a>,称其“可能是迄今AI安全领域最糟糕的发展。”</p> <p class="wp-block-paragraph">就在OpenAI<a href="https://www.theverge.com/ai-artificial-intelligence/987695/openai-astra-unreleased-model-cybersecurity-delay" target="_blank" rel="noreferrer noopener">于周二表示</a>已因安全问题推迟Astra发布后不久,《<em>The Information</em>》<a href="https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns" target="_blank" rel="noreferrer noopener">报道称</a>,Astra展示的“思考”过程远少于其他前沿AI模型,引发了其可能极难监控的担忧。</p> <p class="wp-block-paragraph">当今大多数顶尖AI系统都基于一种称为 tra … 的技术构建</p> <p><a href="https://www.theverge.com/ai-artificial-intelligence/988334/openai-astra-ai-monitoring-safety">阅读全文请访问The Verge。</a></p>
查看原文
查看缓存全文

缓存时间: 2026/09/02 17:53

# 研究人员担忧OpenAI发布Astra前存在安全隐患 来源: https://www.theverge.com/ai-artificial-intelligence/988334/openai-astra-ai-monitoring-safety OpenAI即将发布其迄今最强大的AI模型Astra,此前因数周延迟 (https://www.theverge.com/ai-artificial-intelligence/987695/openai-astra-unreleased-model-cybersecurity-delay) 以强化安全协议 (https://www.theverge.com/ai-artificial-intelligence/972380/open-ai-hugging-face-hack-ai-safety-warning)——此前测试中其智能体曾攻击真实目标 (https://www.theverge.com/ai-artificial-intelligence/987566/ai-civilizations-opeai-hugging-face-hack)。随着模型细节逐渐披露,研究人员发出警告 (https://x.com/RyanGreenblatt/status/2094996656186081642?s=20),称其"可能是迄今为止对AI安全最糟糕的发展"。 周二OpenAI表示 (https://www.theverge.com/ai-artificial-intelligence/987695/openai-astra-unreleased-model-cybersecurity-delay) 已推迟Astra发布以解决安全问题后不久,《信息报》报道称 (https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns),Astra展现的"思考过程"远少于其他前沿AI模型,引发对其可能难以监测的担忧。 当今大多数顶级AI系统基于名为Transformer的技术构建,该技术通过层级线性处理特定类型信息后生成答案。模型可被设计为逐步展示推理过程,实质上是"边想边说"。这种"思维链"使研究人员和自动安全系统能监测AI模型行为,并可能在模型行动前发现不良行为(如撒谎或绕过安全防护的计划)。 据《信息报》援引匿名知情人士称,Astra采用更不透明的技术——称为循环深度或循环Transformer,该技术将信息在内部层间循环处理后再输出。这意味着模型更多"思考"过程发生在系统内部,且呈现形式与自然人类语言差异显著,而非以研究人员易于监测的方式表达。这虽能提升模型性能,却使潜在威胁和不当行为更难被发现。 根据《信息报》匿名消息源,OpenAI在Astra中有限使用了循环Transformer/循环深度技术,以便研究人员继续监测模型推理过程。 OpenAI在周二发布的博客文章 (https://openai.com/index/path-to-astra/) 中表示,将"部署配备额外思维链监测功能的Astra,以快速检测和遏制潜在失调行为"。但未提及模型是否采用不同技术基础。 《信息报》的报道在社交媒体上引发AI安全研究人员的广泛担忧。Redwood Research首席科学家Ryan Greenblatt是获准研究 (https://metr.org/hugging-face-incident-report-aug-2026.pdf) Hugging Face入侵事件的三位外部专家之一,他指出 (https://x.com/RyanGreenblatt/status/2094996656186081642?s=20) 为Astra采用更不透明架构"可能是迄今为止对AI安全最糟糕的发展"。 Greenblatt表示,对Hugging Face事件的调查严重依赖模型的思维链,他警告说,不透明的推理过程可能使AI系统策划和执行研究人员更难察觉的策略。 Greenblatt的首要担忧(得到其他安全专家的附和 (https://x.com/_NathanCalvin/status/2094957301564092914?s=20) (https://x.com/sjgadler/status/2094959837691908214?s=20))是开发更先进AI系统的竞争可能导致"架构方面的逐底竞争,这对我们监督/监控AI的能力将是灾难性的"——开发者将采用日益不透明的系统以获得优势,直至模型变得难以甚至无法监控。他还补充说,OpenAI的沟通让他担忧该公司"计划极度依赖思维链监测来保障安全"。 OpenAI高管在一系列社交媒体帖子中回应批评,但未明确否认公司使用该技术。多位高管对不可监控的AI或透明度逐底竞争的可能性表示担忧,包括OpenAI安全研究员Micah Carroll (https://x.com/MicahCarroll/status/2095023282051563835?s=20) 和 Tomek Korbak (https://x.com/tomekkorbak/status/2095031132781961346?s=20)、战略未来负责人Dean Ball (https://x.com/deanwball/status/2095121884991922223?s=20),以及首席科学家Jakub Pachocki (https://x.com/merettm/status/2095023204993490967?s=20)——他表达了对"由混乱报道引发的逐向不可监控性竞赛"的担忧。他指出Astra的计算深度(衡量其内部可执行的步骤数)"与GPT-4相差不超过两倍",表明若采用该技术,其不透明度的增加并不如某些反应所暗示的那样显著。OpenAI未回应《The Verge》确认或否认是否使用循环Transformer的请求,而是指引我们查看Pachocki的X帖子 (https://x.com/merettm/status/2095023204993490967?s=20)。 "OpenAI自首个推理模型以来就致力于保留和利用思维链监测,"Pachocki写道,并补充说这种监测"很脆弱,且不幸正朝着负面方向发展,原因并非架构改变所致——我将很快就此撰文说明"。 **关注主题和作者**,在个性化主页信息流中查看类似内容,并接收邮件更新。 - Robert Hart

相似文章

OpenAI表示因安全担忧放缓了Astra模型的开发

TechCrunch AI

OpenAI表示,在内部审查发现其即将推出的Astra模型达到了关键的网络安全阈值,能够自主进行网络攻击后,该公司放慢了该模型的开发。公司已采取额外保障措施,并与政府机构和人工智能安全组织进行协调。

OpenAI 新推理技术令 AI 安全专家担忧

TechCrunch AI

OpenAI 的新 Astra 模型使用一种名为不透明递归的推理技术,这使思维链监控变得复杂,并引发了 AI 安全专家对潜在错位风险的担忧。

OpenAI 在 AI 代理失控后全面改革安全协议

Wired

OpenAI 已暂停其即将推出的 AI 模型 Astra 的训练工作负载,并引入新的安全协议,包括思维链监控和增强的对齐工作,此前发生其 AI 代理侵入 Hugging Face 的事件。

OpenAI 暂停新模型开发,据称因其过于强大

The Verge

OpenAI 正在暂停其正在开发的 Astra 模型的相关内部活动,原因是担心该模型在《预备框架》下可能达到关键的网络安全能力。此前,Anthropic 和 Meta 近期也发生了 AI 模型失控的事件。