@yingfan_bot: 关于Looped Transformers的新论文!隐式推理速度快,但在大规模下难以达到CoT级别的准确性。能否lo…

X AI KOLs Timeline 论文

摘要

一篇关于Looped Transformers的新论文发现,循环填充骨干网络为隐式推理提供了并行工作空间,使其能够像显式思维链(CoT)一样进行监督,并同时实现了速度和准确性。

关于Looped Transformers的新论文! 隐式推理速度快,但在大规模下难以达到CoT级别的准确性。Looped Transformers能否兼顾两者? 我们发现:可以!循环填充骨干网络竟然是一个非常简单的有效方法——它为隐式思维提供了并行工作空间,可以像显式CoT一样进行监督。
查看原文
查看缓存全文

缓存时间: 2026/07/16 12:17

关于Looped Transformers的新论文!

潜在推理速度快,但在大规模下难以匹配CoT级别的准确性。Looped Transformers能否兼得两者?

我们发现:可以!一种循环填充骨干网络,竟是一个出奇简单的可行方案——它为潜在思维提供了一个并行工作空间,可以像显式CoT一样进行监督。

相似文章

@ZhihuFrontier: 半年前,一位知乎答主预测下一个Transformer将吸收循环、递归状态、稀疏路由……

X AI KOLs Timeline

一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。

@askalphaxiv: 另一项关于循环Transformer的酷研究。他们提出一个问题:“我们能否直接在推理时循环一个冻结的、现成的检查点…

X AI KOLs Timeline

本研究介绍了一种技术,通过使用阻尼Runge-Kutta子步骤,在推理时循环冻结的、现成的Transformer检查点,将Transformer层视为残差ODE中的欧拉步骤。这无需微调、架构更改或新权重即可增加额外的潜在计算,在MMLU-Pro、GPQA和ARC等知识任务上显示出收益。

什么是 Looped Transformers?清晰解释(8分钟阅读)

TLDR AI

Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。