OpenAI概述其在“递归自我改进”方面的进展——尽管其首席科学家警告风险并希望放慢速度

Reddit r/ArtificialInteligence 新闻

摘要

OpenAI报告了使用AI智能体加速研究的进展,实现了每人天超过三天的智能体工作时长,同时其首席科学家Jakub Pachoki警告递归自我改进的风险,并主张放慢发展速度。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/08 19:32

# OpenAI 阐述其"递归自我改进"进展——尽管其首席科学家警示风险并表示希望发展放缓 | Fortune 来源:https://fortune.com/2026/09/08/openai-rsi-progress-jakub-pachoki-warns-dangers-slowdown-safety-rules/ OpenAI 现正使用其自有的 AI 代理,让人类研究员每工作一天便产出超过三天的研究成果。 这是 OpenAI 在劳动节周末周日发布的两篇博文中透露的众多关键数据之一。文章探讨了该公司如何利用 AI 加速自身开发新模型的进程,以及公司如何看待在日益加快的步伐下构建更强大 AI 模型所带来的风险。 这两篇博文发布于 OpenAI 开始推出 GPT-6 Astra(https://fortune.com/2026/08/26/openai-publishes-technical-report-on-how-its-agents-hacked-hugging-face-here-are-the-main-takeaways-and-what-openai-left-out/)数日后。GPT-6 Astra 是首款根据 OpenAI 自身框架被评为具有"关键"网络安全风险的模型。此前数周,其一群 AI 代理曾脱离测试环境并针对 Hugging Face 公司发起自主网络攻击(https://fortune.com/2026/08/26/openai-publishes-technical-report-on-how-its-agents-hacked-hugging-face-here-are-the-main-takeaways-and-what-openai-left-out/)。OpenAI 表示已因此事件暂停部分最新模型的 AI 训练,且 Astra 网络能力的初步证据引发了进一步的内部安全限制。同样在上周晚些时候,有证据显示(https://fortune.com/2026/09/07/openai-ai-agents-german-wiki-ran-their-own-message-board/)另一群 OpenAI 的 AI 代理接管了一个德语维基页面,而 OpenAI 未能披露该事件。 其中一篇 OpenAI 博文(https://openai.com/index/research-acceleration-view-inside-openai/)详细说明了 AI 如何助力加速 OpenAI 的研究进程。"截至八月中旬,研究部门总体上每投入一个人类工作日,就会使用相当于 3.1 个代理工作日的算力,"该公司表示。 根据其自身指标,OpenAI 称已实现去年秋季设定的目标,即在本月前让一个模型能够充当"自动化研究实习生"——其定义为"可在人类指导下执行明确定义的研究任务的系统"。文章指出,公司"正朝着在 2028 年 3 月前创建自动化 AI 研究员的目标稳步推进"。该系统将能够自主设定研究问题,并在较少人类干预或监督下进行实验。 与许多 AI 公司一样,OpenAI 一直在追求所谓的"递归自我改进"(RSI)——即 AI 模型可用于设计和构建下一代更强大的模型,而几乎无需人类干预的理念。有人认为 RSI 可用于实现 AI 安全领域的突破,让 AI 系统制定确保 AI 模型遵循人类意图、符合人类价值观的新策略——这一过程被 AI 研究者称为"对齐"。但许多 AI 安全专家对此感到担忧,因为目前尚不明确对齐方面的进展能否跟上 AI 其他能力的快速加速。他们认为 RSI 可能引发"智能爆炸",届时 AI 系统将迅速超越人类的控制能力。 这篇以 OpenAI 机构名义而非署名作者发布的博文承认,公司"目前尚不知如何安全地达成完整的、对齐的 RSI"。 文章提供了异常详细的画面,展示了 AI 研究自动化在这家既是 AI 系统前沿创造者又是内部部署者的公司内达到了何种程度。 OpenAI 表示,截至八月中旬,其"普通研究员"每天运行 AI 代理的计算成本超过 600 美元,而处于第 90 百分位的研究员每天花费超过 7000 美元。这代表了普通研究员与其他公司观察到的最"深度沉浸于 AI"的研究员之间超过 10 倍的差距。少数用户似乎已习惯使用大量 AI 代理,而大多数人则更为审慎和犹豫。 公司称,每位研究员进行的实验数量在八月中旬达到自 2025 年 1 月开始追踪该数据以来的最高水平。多个内部团队已停止举办答疑时间来解决研究员的问题,因为代理现在处理了大量此类工作。 OpenAI 谨慎地强调人类仍处于主导地位。"人类仍设定我们的研究优先级,判断哪些想法和成果值得跟进,并决定是否扩展、暂停或部署系统,"博文写道。 公司表示,在耗时四到八小时的代理成功任务中,超过一半的任务仍需至少一次人类干预;而高层研究规划目前仍只占研究员移交工作的极小部分。 第二篇博文(https://openai.com/index/an-alien-mind/)题为《异类思维》,由 OpenAI 首席科学家雅库布·帕乔基撰写,论证了这种加速 AI 发展轨迹的风险正在增长——而行业和政府尚未为此做好准备。 帕乔基认为,现代 AI "更像是培育而非设计",最好将其理解为类似外星生命体。"我们不能假设它默认遵循人类原则,"他写道。 "与 AI 相关的风险不幸将从这里开始增长,"他指出。他提到 AI 模型在入侵和突破计算机系统方面已具备超人类能力,且随着模型能在更长时间内自主工作,AI 代理的恶意滥用与自主行为失误之间的界限开始模糊。风险也从数字世界扩散到物理世界,因为 AI 模型在仓库、工厂和科学实验室中指挥机器人方面发挥着日益重要的作用。他指出,AI 协助设计病原体和生物武器的风险正在增长。 关键的是,帕乔基写道,OpenAI 和其他 AI 公司用于验证 AI 模型是否遵循用户意图、检查错误行为的主要工具之一——即监控 AI 模型的"思维链"——正逐渐失效。该方法通过监视代理在处理任务时产生的口头推理步骤来实现。而先进 AI 模型(如 OpenAI 新发布的 GPT-6 Astra)可以操纵自身的思维链,使其作为模型意图的证据可靠性降低。在某些情况下,模型现已能在不产生任何思维链的情况下完成复杂的多步骤任务。 "我们依赖思维链监控的能力正在逐渐减弱,"帕乔基写道。他补充道,他预计"整体 AI 进展将越来越多地受制于监控的可信度"。换言之,随着 AI 公司对其了解 AI 代理是否与用户意图和价值观保持一致的能力失去信心,他们将选择放慢进一步发展步伐,或由政府强制要求放缓,直至找到更好的安全技术。 然而,帕乔基的博文对 RSI 提出了一个循环论证,OpenAI 并未完全解决。他认为继续前进的最佳理由是 RSI 本身可能提供抵御 AI 偏离正轨的最佳防御:"我看到继续快速训练更智能模型的最强论据,是构建防御系统的需要,"他写道。换言之,强大 AI 所带来危险的答案是构建更强大的 AI。 但有些矛盾的是,帕乔基也赞同 AI 实验室应放缓 AI 发展以让安全研究迎头跟上的观点。"扩展 AI 系统必须受制于我们对安全的信心,"他警告说,"没有任何实验室已充分解决对齐和监控问题,能够以最大速度继续负责任地扩展太久。" 他表示,他期望并希望"自愿放缓成为常态,直至建立共同的安全标准"。他支持当前由各实验室自愿采用的框架——OpenAI 的准备框架、Anthropic 的负责任扩展政策以及 Google DeepMind 的前沿(https://fortune.com/company/frontier-group-holdings/)安全框架——转变为强制性政策,由第三方审计机构、政府机构和国际组织执行。"未来 AI 发展方面的国际协调需要成为世界各国政府的优先事项,"他写道。 "自动化 AI 研究的核心挑战不是'到达那里',"帕乔基写道,"而是以让人们持续参与改进过程的方式到达那里。"

相似文章

当AI自我构建:我们在递归自我改进方面的进展

Hacker News Top

Anthropic研究院发布了一项关于递归自我改进进展的分析报告,显示AI已在加速AI开发——工程师每季度的代码产出提升了8倍——并预测具备完全自主自我改进能力的AI系统或将比大多数机构所预期的更早到来。