@che_shr_cat: 1/ 一个5M参数的模型刚刚在困难逻辑谜题上击败了前沿LLM,推理成本不到其十万分之一。…
摘要
一个5M参数的模型通过使用连续潜空间测试时计算,在困难逻辑谜题上以极低的推理成本超越了前沿LLM。
查看缓存全文
缓存时间: 2026/06/30 07:37
1/ 一个仅有500万参数的模型,以不到前沿大语言模型十万分之一的推理成本,就在硬逻辑谜题上击败了它们。
怎么做到的?通过将测试时计算扩展到连续潜在空间,而非离散的token空间。
让我们来详细拆解这是如何实现的。
2/ 论文:《概率性微型递归模型》(Probabilistic Tiny Recursive Model,PTRM),作者:Amin Sghaier、Ali Parviz 和 @jm_alexia。
该论文解决了微型递归模型(TRM)的一个重大缺陷:在推理过程中,它们会陷入潜在空间中的次优盆地。
3/ PTRM 并非执行单一确定性的展开,而是运行 K 条并行轨迹。
在每个递归步骤,它会直接将微小的高斯噪声注入到潜在状态中: z_t = rec(x, z_{t-1} + 噪声)
这种噪声有助于轨迹逃离局部吸引子。
4/ 如何在最后选择正确的轨迹?
作者重新利用了预训练的 Q 头(原本仅在训练期间用于控制停止),将其作为零样本验证器。
选择 Q 头置信度得分最高的路径。无需重新训练。
5/ 你可能会认为梯度引导的搜索(如 Langevin 采样)比随机噪声效果更好。
但经验消融实验表明,沿着梯度推动潜在状态相比纯高斯噪声并无优势。
纯噪声简单、快速,且无需任何反向传播。
6/ 结果令人惊叹: • PPBench 准确率:从 62.6% 提升至 91.2% • 数独-极难:98.75% • 成本:每个解决方案仅需 0.001 美元,而前沿大语言模型集成方案需要 38.51 美元
这证明了,大规模自回归模型并非实现深度推理的唯一途径。
7/ 主要局限性?验证器瓶颈。
PTRM 的性能受限于 Q 头的准确率。在 Maze-Hard 这类任务中,理论上的最优性能(95.6%)与 Q 头选择出的性能(85.1%)之间存在巨大差距。
8/ 这项工作表明,测试时扩展可以完全在连续潜在空间中进行。
当我们遇到基于 token 的搜索(如 MCTS、RL)的极限时,探索紧凑模型中的连续、多步扰动看起来极具前景。
9/ 阅读我的完整解读文章: https://arxiviq.substack.com/p/probabilistic-tiny-recursive-model…
查看论文原文: https://arxiv.org/abs/2605.19943
你对连续式与离散式测试时扩展有何看法?欢迎留言交流!
10/ 我还制作了一张可视化示意图,展示了这些潜在轨迹如何逃离不良盆地。
相似文章
GLM-5 拥有744B参数,但在MMLU-Pro上的得分却不如一个9B模型
GLM-5是一个拥有744B参数的模型,但在MMLU-Pro基准测试中的表现不如一个远小得多的9B模型,这引发了关于效率和扩展性的问题。
我从零开始训练了一个75M参数的LLM,使用18B tokens,它击败了几乎两倍大小的模型
从零开始训练了一个名为KeyLM的75M参数LLM,使用18B tokens,在指令跟随得分上与更大模型竞争,同时使用更少的参数和更少的数据。
@j_golebiowski:17 亿参数模型在 Schema Guided Dialogue 上击败 7440 亿参数的 GLM-5——即便训练数据被污染。这相当于……
17 亿参数模型在训练数据受损的情况下,仍在 Schema Guided Dialogue 任务上超越 7440 亿参数的 GLM-5,体积效率高达 437 倍。
@lateinteraction: 非常酷的工作!!
Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。
OpenAI的最新研究表明,LLM能够解决数学领域的前沿问题(1分钟阅读)
OpenAI的研究表明,LLM能够解决九个开放数学问题,这些来自COLT、FOCS、交换代数和Erdős问题,采用包含GPT-5.5 Pro和Claude Opus 4.8的简单pipeline,并使用了Lean形式化验证。