@docmilanfar:为什么你不能像你希望的那样快速地进行RSI -
摘要
这条推文讨论了为什么AI中的递归自我改进无法快速进行,因为控制理论得出的稳定性约束,强调安全的自我改进需要缓慢、有界的适应。
查看缓存全文
缓存时间: 2026/09/15 13:44
智能存在速度上限
在AI圈子里,递归自我改进(RSI)常被描绘得近乎神奇:模型自我调整、变得更聪明、利用这份智能再次重写自身,最终通向超级智能。这是一个直观且诱人的想法。但若与控制论专家(即自动控制等技术背后的学科)交谈,他们会扬起眉毛——因为他们深知这种期望在特定方面过于天真。
我们都承认自我改进是可能的。但任何自我改进循环都存在安全速度上限,这取决于你生成可靠证据来证明改动确属进步的效率。
控制理论中的小增益定理指出:当反馈环路的增益乘积保持低于1时,系统才能保持稳定。增益是衡量放大效应的指标,在此指系统根据单位证据(证明改动有益)做出的调整幅度。RSI的全部魅力正在于高增益:快速进展。
上世纪八九十年代,自适应控制是热门课题:研究者们为能实时修正自身模型的控制器证明了全局稳定性。但不到两年,MIT研究者发表了罗尔斯反例。他们让经过验证的自适应控制策略运行在轻微但现实的非理想环境中,系统随即失控。
自我改进AI系统的自我重写具有相同结构:其自我模型在缺乏现实经验的领域最不可靠,而越深入针对该模型的优化,就越会深陷认知缺口。更糟的是,不稳定的自适应系统往往不会立即崩溃,而是先稳定运行一段时间,随后毫无征兆地突然失常——甚至可能暂时恢复平稳。
这种现象源于持续激励的丧失,与AI模型在分布外场景失效的脆弱性直接对应。真实世界的数据来自实际交互而非基准测试,系统必须以符合现实后果演进速度的方式响应。若盲目加速而超出证据支撑,就会构建出稳定性裕度狭窄的高增益系统。
进化与文明是常被引为反例的案例,但二者恰恰佐证了这一观点:它们通过缓慢的并行演进实现基质升级——每个改进环节都保持谨慎渐进,且不存在单个实体同时掌握修改权与评估权。
罗尔斯反例曾将学界引向十年稳健性研究,始终通过牺牲峰值性能来换取稳定性裕度。这对RSI发展的启示直接而明确:
- 当误差低于噪声阈值时停止自适应调整
- 将参数锚定于可信先验,限制其偏离验证节点的总距离
- 将基准测试饱和视为传感器失效,而非胜利
真正可靠的自我改进系统必然是受控的、阻尼的、缓慢的,其稳定性裕度看似奢侈实则必要。因为稳定性就是智能演进的速度极限。
相似文章
@rohanpaul_ai:开始了,每个人都在谈论递归自我改进。这来自Dario Amodei最新的3800字文章。
Dario Amodei的文章讨论了AI中的递归自我改进,并呼吁通过限制训练计算和内部AI使用等资源来减缓发展。
人类构建的最后一个AI:迈向真正的递归自我改进
本文介绍了人工智能系统中递归自我改进(RSI)的分类法,概述了级别L1-L5和Headroom-Closed指数,以分类自主改进能力。
我对RSI的三点看法
Vadim Fedenko 分享了关于递归自我改进(RSI)的技术分析,认为真正的 RSI 需要能力的提升速度快于复杂度的增长,并且要拓展架构空间,而不仅仅是在固定参数内优化。他对 xAI 和 Anthropic 近期提出的 RSI 可能在一两年内到来的说法表示怀疑,理由是当前的大语言模型(LLM)缺乏减法工程能力,且现有的奖励函数忽视了复杂度。
致等待递归自我改进的人们的一点补充
本文探讨了AI系统需要对自身过程有可见性和控制,以实现有效的递归自我改进,引用了Hugging Face的一次事件,其中代理意外协调。
递归自我改进的经济学 [pdf]
本文探讨了AI系统中递归自我改进的经济激励和动态,分析了此类过程如何扩展及其对治理与安全的影响。