@rasbt: 我整理了一篇关于 GPT-6 Astra 和循环 Transformer 的大型文章。介绍了循环 Transformer / 递归深度的工作原理,等

X AI KOLs Timeline 论文

摘要

一篇全面的文章,解释了 AI 中的循环 Transformer 和递归深度,包括成本权衡以及它们是否隐藏推理痕迹,配有图表和近期研究的综述。

我整理了一篇关于 GPT-6 Astra 和循环 Transformer 的大型文章。 介绍了循环 Transformer / 递归深度的工作原理、成本权衡、是否隐藏推理痕迹,配有大量图表和近期循环 Transformer 研究的概览。https://t.co/VR6HaPFVXH
查看原文
查看缓存全文

缓存时间: 2026/09/09 13:53

我整理了一篇关于 GPT-6 Astra 与循环 Transformer 的深度长文。

内容涵盖循环 Transformer/递归深度的工作原理、成本权衡、推理痕迹是否被隐藏,并附有大量图表与近期循环 Transformer 研究综览。https://t.co/VR6HaPFVXH

相似文章

OpenAI Astra与循环Transformer(2分钟阅读)

TLDR AI

本文澄清了围绕OpenAI Astra模型的炒作,解释了‘循环Transformer’概念是一种小型架构调整,通过重用层来增加容量而不增加参数,如在Nanbeige 4.2等模型中所见。

@ZhihuFrontier: 半年前,一位知乎答主预测下一个Transformer将吸收循环、递归状态、稀疏路由……

X AI KOLs Timeline

一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。

@askalphaxiv: 另一项关于循环Transformer的酷研究。他们提出一个问题:“我们能否直接在推理时循环一个冻结的、现成的检查点…

X AI KOLs Timeline

本研究介绍了一种技术,通过使用阻尼Runge-Kutta子步骤,在推理时循环冻结的、现成的Transformer检查点,将Transformer层视为残差ODE中的欧拉步骤。这无需微调、架构更改或新权重即可增加额外的潜在计算,在MMLU-Pro、GPQA和ARC等知识任务上显示出收益。

什么是 Looped Transformers?清晰解释(8分钟阅读)

TLDR AI

Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。