@FrancoisChauba1: 如果你在(未排序列表、冒泡排序过程、已排序列表)的轨迹上进行训练,你永远无法通过测试时计算(TTC)达到…
摘要
一篇批评文章指出,在人类生成的数据上训练LLM限制了它们通过测试时计算发现新颖解决方案的能力,而真正的AGI需要模型能够像AlphaZero那样更广泛地探索假设空间。
查看缓存全文
缓存时间: 2026/05/26 20:56
如果你训练(未排序列表、冒泡排序过程、已排序列表)的轨迹,你永远无法通过测试时计算(TTC)找到归并排序。
于是前沿实验室的人说:“我们不只是训练一个算法,而是训练多类排序算法,这样它应该能探索排序的函数空间。”
但你仍然受到限制。
举例来说,假设我们不了解非比较排序(基数排序)。但我们训练了所有比较排序算法……同样的问题。它不会采样非比较排序算法!怎么会?它不能正交地思考?但人类可以!
OAI 仍然认为这是通向 AGI 的道路?!
不可能。
现代的 LLM 技术栈本质上就是模仿学习,加上通过测试时计算(TTC)进行少量搜索,利用生成-验证差距自我蒸馏回权重中。
这始终会将你限制在训练流形的函数空间中进行搜索。
这使得发现那些远优于人类流形但远离人类思维的全新程序几乎不可能通过 TTC 找到。
我们需要教模型一种更通用的搜索过程,以探索完整的假设空间,而不受人类思维的重度偏见影响(例如 AlphaZero)。人们已经放弃了这种方法,因为在大的动作空间中,DQN+MCTS 会崩溃。但不应该仅仅因为实现无法扩展就抛弃这个想法。而这正是大家似乎都在做的。
如果我们想要真正的 AGI,我们需要能够从第一性原理出发思考的模型,以巧妙的方式进行分支和探索,走完剩余的路。这本质上就是在模仿科学方法。
提出正确的问题 / 进行巧妙的实验,以缩小假设空间。
为什么前沿实验室还没有意识到这一点?还是说这是对我们所有人的心理战?
相似文章
@tunguz:这是一个重要原因。非LLM推理任务的时间只会增加。然而,工具…
一篇文章指出,现代自主编码中42%的时间用于基于CPU的工具使用,效率低下,这为重新设计面向AI代理的工具提供了巨大机遇。
@polynoamial: https://x.com/polynoamial/status/2064210146558136827
本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。
@jeremyphoward: 我觉得训练模型自主去尝试自己做所有事情的趋势是反人类的。…
Jeremy Howard 反对训练AI模型自主地做所有事情,而主张训练LLMs来支持人类学习、创造力和迭代实验。
为什么不能训练LLMs用一种优化的AI语言而非英语来思考?
一个推测性的讨论,质疑为什么LLMs没有被训练使用优化的内部语言而非自然语言来思考,以及这是否能提高效率。
@maxrumpf: 人类是低上限
Max Rumpf 认为,在训练先进AI模型时,人类反馈正变得过时,他引用了国际象棋、数学和搜索等例子。他主张使用自我对弈和合成数据等无需人类的方法,而Will Depue的一条引用推文则呼吁建立与计算规模相平行的大规模数据基础设施。