验证器瓶颈
摘要
一篇概念性文章,认为人工智能中的递归自我改进受限于验证而非计算,并使用了认识论封闭的提示矩阵和数据加工不等式的隐喻。
暂无内容
查看缓存全文
缓存时间: 2026/08/11 03:28
# 验证器的瓶颈
来源:https://medium.com/@vishalmisra/the-verifier-bottleneck-4fb0d8c8f3a9
Vishal Misra (https://medium.com/@vishalmisra?source=post_page---byline--4fb0d8c8f3a9---------------------------------------)
*为什么递归自我改进受限于验证,而非计算。*
按回车或点击查看全尺寸图片
机器从来不是瓶颈。OpenAI 最近的数学成果引发了我的两个问题。在 *After the Proof* 中,我探讨了第一个:有趣的问题不再是机器能否产生前沿数学,因为它们显然可以,而是成功搜索之后留下的是什么。今天的证明会成为明天的直觉吗?昂贵的搜索是否会留下捷径,使下一次搜索更便宜?这篇文章提出了互补的问题:究竟是什么最终限制了递归自我改进?
## 封闭的矩阵
几年前,我和 Siddhartha Dalal 引入了我们称之为 *The Matrix* 的概念对象,而非字面上的矩阵。想象每一个可能的提示词作为一行,每一个可能的下一个词元分布作为一列。即使对于像 ChatGPT 3.5 这样不算大的模型,以其词汇量和上下文窗口,完整的矩阵所包含的行数也将远超可观测宇宙中的电子数。这些行大多数是乱码,剩余的大部分也几乎全为零。即使丢弃几乎所有内容,剩下的仍然大得难以想象,因此语言模型从不存储矩阵本身。它们存储一个压缩近似,用以重建自然语言实际占据的那一小块区域。
如果矩阵只是隐式的,那么新的计算从哪里来?长乘法回答了这个问题。语言模型并不存储每一对整数的乘积;这样的组合太多了。它存储的是如何相乘。一旦提示词识别出这种潜在计算,思维链就将其展开:每一次进位产生下一个中间状态,而这个状态又成为下一个提示词。新的行出现在概念矩阵中,而它们从未被记忆过。前一行决定下一行。算法早已存在,思维链只是执行它。
数学证明也是如此。模型并不存储每一个证明;它存储大量可复用的数学构造,等待被展开,而思维链通过它们发现一条轨迹。这种搜索非常昂贵(就词元和探索轨迹而言,而不是美元!),但它仍然是对概念矩阵行的遍历。递归自我改进可以让这种展开大幅降低成本,但无法让矩阵变得更大。这个矩阵在认识论上是封闭的。
## 只有验证器增加信息
唯一能增加信息内容的是验证器。这是数据处理不等式在推理中的应用:无论你如何处理自己的输出,都无法获得比验证器贡献的更多关于现实的比特。递归自我改进让方案变得更好,而不是更真实。计算购买的是方案;验证器购买的是知识。
其他一切都由此而来。这解释了为什么数学成为 AI 取得前沿发现的第一门学科,因为循环的两个部分都存在于计算之内。方案来自模型,而验证器是另一项计算,例如证明检查器或符号代数。每次失败的搜索只需多花费几千个词元,整个循环在硅片内部闭环。
## 科学将验证器移出计算
科学只改变一件事:它把验证器移出计算。方案仍然来自计算,但验证器不再来自计算。药物必须通过临床试验,材料必须被合成,飞机必须飞起来。自然回答了模型无法自行回答的问题。
AlphaFold 是最清晰的例子。它极大地压缩了对蛋白质结构的搜索,但几年过去,它并没有解决生物学问题。它解决了生物学搜索中一个昂贵的部分,并立即暴露了下一个瓶颈:科学家仍然必须决定哪些结构重要、它们暗示了什么机制、以及哪些实验值得进行。每一个真正新的比特仍然来自实验,而不是来自更努力地思考 AlphaFold 自身的预测。瓶颈从搜索转移到了验证。
这就是为什么递归自我改进在数学中看起来与在科学中会不同。在数学中,搜索与路径的比率可以持续下降,因为验证器几乎是免费的。在科学中,每条捷径都更加重要,因为每一条错误路径都要向自然购买。极限不在于模型能多快地思考,而在于每个验证器比特能多高效地成为下一个捷径。
*After the Proof* 一文认为,AI 的未来取决于成功的搜索是否会留下可复用的直觉。互补的观点是:捷径让搜索更便宜,但只有验证器才能让知识变得更大。未来不取决于机器能以多快的速度重新处理昨天的发现,而取决于验证器能以多快的速度交给它们一个新比特,以及每个比特留下多少直觉。瓶颈从来都不是计算。它一直是验证器。
相似文章
闭合验证循环(14分钟阅读)
一篇详细文章,讨论闭合验证循环的概念,可能涉及AI或软件验证流程。
验证前沿:编码智能体奖励并无银弹
本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。
@bcherny:我们经常讨论设置自我验证循环的重要性。尤其是在强大模型日益普及的时代…
讨论在像Claude这样的AI模型中自我验证循环的重要性,以提高可靠性并减少人工监督的需要。
基于验证器与无验证器的测试时扩展结果比人们认为的更早,并且它不断得到确认 [D]
这篇文章讨论了已确认的研究发现:基于验证器的测试时计算扩展主导无验证器方法,并以Apodex等实际例子展示了分离验证过程带来的收益。它认为构建独立验证器是未来AI能力提升的关键路径。
@GregKamradt: "代码和数学正在蓬勃发展,因为它们易于验证,下一个前沿是难以验证的领域" Th…
Greg Kamradt 提出了一个AI验证难度的7级谱系,范围从像数学和代码这样可即时验证的领域,到具有缓慢、嘈杂反馈的文明规模系统。