@che_shr_cat: 1/ 一个5M参数的模型刚刚在困难逻辑谜题上击败了前沿LLM,推理成本不到其十万分之一。…

X AI KOLs Timeline 论文

摘要

一个5M参数的模型通过使用连续潜空间测试时计算,在困难逻辑谜题上以极低的推理成本超越了前沿LLM。

1/ 一个5M参数的模型刚刚在困难逻辑谜题上击败了前沿LLM,推理成本不到其十万分之一。 如何做到的?通过在连续潜空间中扩展测试时计算,而非离散的令牌空间。 让我们来解析其工作原理。🧵 https://t.co/fYZIyEFqpI
查看原文
查看缓存全文

缓存时间: 2026/06/30 07:37

1/ 一个仅有500万参数的模型,以不到前沿大语言模型十万分之一的推理成本,就在硬逻辑谜题上击败了它们。

怎么做到的?通过将测试时计算扩展到连续潜在空间,而非离散的token空间。

让我们来详细拆解这是如何实现的。

2/ 论文:《概率性微型递归模型》(Probabilistic Tiny Recursive Model,PTRM),作者:Amin Sghaier、Ali Parviz 和 @jm_alexia。

该论文解决了微型递归模型(TRM)的一个重大缺陷:在推理过程中,它们会陷入潜在空间中的次优盆地。

3/ PTRM 并非执行单一确定性的展开,而是运行 K 条并行轨迹。

在每个递归步骤,它会直接将微小的高斯噪声注入到潜在状态中: z_t = rec(x, z_{t-1} + 噪声)

这种噪声有助于轨迹逃离局部吸引子。

4/ 如何在最后选择正确的轨迹?

作者重新利用了预训练的 Q 头(原本仅在训练期间用于控制停止),将其作为零样本验证器。

选择 Q 头置信度得分最高的路径。无需重新训练。

5/ 你可能会认为梯度引导的搜索(如 Langevin 采样)比随机噪声效果更好。

但经验消融实验表明,沿着梯度推动潜在状态相比纯高斯噪声并无优势。

纯噪声简单、快速,且无需任何反向传播。

6/ 结果令人惊叹: • PPBench 准确率:从 62.6% 提升至 91.2% • 数独-极难:98.75% • 成本:每个解决方案仅需 0.001 美元,而前沿大语言模型集成方案需要 38.51 美元

这证明了,大规模自回归模型并非实现深度推理的唯一途径。

7/ 主要局限性?验证器瓶颈。

PTRM 的性能受限于 Q 头的准确率。在 Maze-Hard 这类任务中,理论上的最优性能(95.6%)与 Q 头选择出的性能(85.1%)之间存在巨大差距。

8/ 这项工作表明,测试时扩展可以完全在连续潜在空间中进行。

当我们遇到基于 token 的搜索(如 MCTS、RL)的极限时,探索紧凑模型中的连续、多步扰动看起来极具前景。

9/ 阅读我的完整解读文章: https://arxiviq.substack.com/p/probabilistic-tiny-recursive-model…

查看论文原文: https://arxiv.org/abs/2605.19943

你对连续式与离散式测试时扩展有何看法?欢迎留言交流!

10/ 我还制作了一张可视化示意图,展示了这些潜在轨迹如何逃离不良盆地。

相似文章

@lateinteraction: 非常酷的工作!!

X AI KOLs Timeline

Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。