@askalphaxiv: 由Yoshua Bengio指导的一篇精彩论文 "Generative Recursive Reasoning" 测试时计算不仅应…
摘要
论文《Generative Recursive Reasoning》提出了一种方法,通过并行采样多个潜在推理轨迹来扩展测试时计算,使模型能够探索多样化的假设并避免确定性坍缩。该方法在数独、ARC AGI、N皇后和图形着色等任务上提升了性能,还可以从头生成有效的数独棋盘和MNIST数字。
查看缓存全文
缓存时间: 2026/05/21 19:39
一篇由Yoshua Bengio指导的有趣论文
“生成式递归推理”
测试时计算不仅应该通过思考得更深来扩展,还应该通过思考得更广。
这篇论文将递归生成式化。它采样了大量潜在推理轨迹,让模型并行探索多个假设,从而避免沿着一条确定性路径坍缩到单一答案。
它改进了数独、ARC AGI、N皇后和图着色问题,同时还能从头生成有效的数独棋盘和MNIST数字。
相似文章
生成式递归推理
本文介绍了生成式递归推理模型(GRAM),这是一个概率框架,通过支持随机潜在轨迹、多个假设以及通过深度和并行采样实现推理时缩放,扩展了递归推理模型。
@machinestein: ICML 2026:TRMs中的潜在推理实际上是策略改进算子 为什么递归推理,尤其是…
论文揭示了基于transformer的推理模型(TRMs)中的潜在推理实际上充当了策略改进算子,并提出了一种算法,将学习和推理效率提升高达18倍。
@chenxiao_yang_: 对于更长范围的任务,我们常常考虑使用长上下文模型。但框架也很重要!实际上,它们……
这篇 ICML 论文介绍了递归模型,这些模型递归地调用自身在隔离上下文中解决子任务,证明它们可以在长时推理中超越上下文受限的自回归模型。在 SAT 求解和围棋博弈树搜索上的实验表明,使用较小的活动上下文能提高准确性。
推理、代码,还是两者兼有?大型语言模型如何处理数学问题的变化
本文使用 Claude Haiku 4.5 在 1000 个 GSM-Symbolic 问题上评估了三种方法(纯思维链推理、单次代码执行和迭代代码执行),发现思维链对扰动最为鲁棒,而代码执行并未提升小学数学问题的推理鲁棒性。
TMAS:通过多智能体协同扩展测试时计算
TMAS 引入了一种多智能体框架,通过结构化协作与分层记忆系统扩展测试时计算,从而增强大语言模型的推理能力。该方法采用专用智能体、跨轨迹信息流以及混合奖励强化学习,有效提升了模型在复杂推理基准上的迭代扩展性能与稳定性。