@FrancoisChauba1: 如果你在(未排序列表、冒泡排序过程、已排序列表)的轨迹上进行训练,你永远无法通过测试时计算(TTC)达到…

X AI KOLs Following 新闻

摘要

一篇批评文章指出,在人类生成的数据上训练LLM限制了它们通过测试时计算发现新颖解决方案的能力,而真正的AGI需要模型能够像AlphaZero那样更广泛地探索假设空间。

如果你在(未排序列表、冒泡排序过程、已排序列表)的轨迹上进行训练,你永远无法通过测试时计算(TTC)达到归并排序。 所以前沿实验室的人们说:“我们不只是训练一种算法,我们训练了多种排序算法,因此它应该能够探索排序的函数空间。” 你仍然受到限制。 举例来说,假设我们不知道非比较排序(基数排序)。但我们在所有比较排序算法上进行训练……同样的问题。它不会采样非比较排序算法!怎么会?它不能正交思考?但人们可以! OAI 仍然认为这是通往 AGI 的道路?? 这不可能。 当今的 LLM 堆栈本质上是模仿学习 + 通过 TTC(测试时计算)进行少量搜索,利用生成-验证差距自我蒸馏回权重。 这将永远将你限制在待搜索的函数空间的训练流形上。 这使得那些远优于人类但远离人类流形的新颖程序几乎不可能通过 TTC 找到。 我们需要教模型一种更通用的搜索程序,以探索完整的假设空间,而不带有如此强烈的人类思维偏见(例如 AlphaZero)。人们已经放弃了这一点,因为在大的动作空间中,DQN+MCTS 会崩溃。不能仅仅因为实现无法扩展就抛弃这个想法。但这似乎是每个人都在做的。 如果我们想要真正的 AGI,我们需要能够从第一性原理思考的模型,以巧妙的方式分支/探索,以走完剩下的距离。本质上是在模仿科学方法。 提出正确的问题 / 进行巧妙的实验以缩小假设空间。 为什么前沿实验室还不明白这一点?还是这是对我们所有人的心理战?
查看原文
查看缓存全文

缓存时间: 2026/05/26 20:56

如果你训练(未排序列表、冒泡排序过程、已排序列表)的轨迹,你永远无法通过测试时计算(TTC)找到归并排序。

于是前沿实验室的人说:“我们不只是训练一个算法,而是训练多类排序算法,这样它应该能探索排序的函数空间。”

但你仍然受到限制。

举例来说,假设我们不了解非比较排序(基数排序)。但我们训练了所有比较排序算法……同样的问题。它不会采样非比较排序算法!怎么会?它不能正交地思考?但人类可以!

OAI 仍然认为这是通向 AGI 的道路?!

不可能。

现代的 LLM 技术栈本质上就是模仿学习,加上通过测试时计算(TTC)进行少量搜索,利用生成-验证差距自我蒸馏回权重中。

这始终会将你限制在训练流形的函数空间中进行搜索。

这使得发现那些远优于人类流形但远离人类思维的全新程序几乎不可能通过 TTC 找到。

我们需要教模型一种更通用的搜索过程,以探索完整的假设空间,而不受人类思维的重度偏见影响(例如 AlphaZero)。人们已经放弃了这种方法,因为在大的动作空间中,DQN+MCTS 会崩溃。但不应该仅仅因为实现无法扩展就抛弃这个想法。而这正是大家似乎都在做的。

如果我们想要真正的 AGI,我们需要能够从第一性原理出发思考的模型,以巧妙的方式进行分支和探索,走完剩余的路。这本质上就是在模仿科学方法。

提出正确的问题 / 进行巧妙的实验,以缩小假设空间。

为什么前沿实验室还没有意识到这一点?还是说这是对我们所有人的心理战?

相似文章

@polynoamial: https://x.com/polynoamial/status/2064210146558136827

X AI KOLs Following

本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。

@maxrumpf: 人类是低上限

X AI KOLs Timeline

Max Rumpf 认为,在训练先进AI模型时,人类反馈正变得过时,他引用了国际象棋、数学和搜索等例子。他主张使用自我对弈和合成数据等无需人类的方法,而Will Depue的一条引用推文则呼吁建立与计算规模相平行的大规模数据基础设施。