模块化TTT:将测试时训练重新构想为可组合模块
摘要
本文介绍了模块化TTT,这是一个将测试时训练的内部学习器表示为有向无环图的框架,能够对组件进行系统的消融和组合。作者在1000亿个token上训练了4.1亿和14.5亿参数规模的模型,取得了与GatedDeltaNet相当的性能。
查看缓存全文
缓存时间: 2026/08/10 06:14
论文页面 - Modular TTT: 将测试时训练重新思考为可组合模块
来源:https://huggingface.co/papers/2608.07110
摘要
测试时训练(TTT)将序列建模视为一个在线学习问题,其中快速权重通过内部学习规则进行更新。尽管 TTT 变体的数量不断增长,现有方法通常将每种变体单独硬编码,这使得设计新的 TTT 方法以及隔离每个组件的作用变得困难。为了解决这个问题,我们提出了 Modular TTT,一个将内部学习器表示为有向无环图的框架,并将快速权重网络、损失函数、学习率、权重衰减和归一化暴露为显式的设计维度。Modular TTT 自动将原始级别的训练视角前向传播、训练视角反向传播和因果查询视角规则组合成完整的图级 TTT 计算,包括快速权重状态转换。使用 Modular TTT,我们系统性地消融了 TTT 的各个组件,发现较小的学习率初始化、权重衰减和单层非线性能够提升性能,而 MSE 和内积损失的表现相似。更深的快速权重网络和归一化往往会损害性能,因为它们会导致过大的激活值,而残差连接和门控带来的可测量收益很小。在这些发现的指导下,我们将最佳变体训练为 410M 和 1.45B 参数的模型,在 100B tokens 上训练,并观察到训练损失和基准性能与 Gated DeltaNet 相当。
查看 arXiv 页面 (https://arxiv.org/abs/2608.07110)查看 PDF (https://arxiv.org/pdf/2608.07110)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.07110)
在你的 agent 中获取这篇论文:
hf papers read 2608\.07110
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接到这篇论文
在模型 README.md 中引用 arxiv.org/abs/2608.07110 以将其链接到此页面。
引用该论文的数据集0
没有数据集链接到这篇论文
在数据集 README.md 中引用 arxiv.org/abs/2608.07110 以将其链接到此页面。
引用该论文的 Space0
没有 Space 链接到这篇论文
在 Space README.md 中引用 arxiv.org/abs/2608.07110 以将其链接到此页面。
包含该论文的收藏1
相似文章
测试时训练破坏安全护栏
本文识别了测试时训练(TTT)的三种威胁模型,攻击者可利用这些模型绕过LLM的安全过滤器,实现高攻击成功率。研究结果表明,TTT引入了新的漏洞,破坏了现有的安全护栏。
长上下文大语言模型的自引导测试时训练
提出了自引导测试时训练(S-TTT)方法,模型在长上下文中识别相关证据片段进行自适应,在长上下文推理基准上实现了高达15%的相对改进。
@ai4research_ucb: TTT-Discover 通过在测试问题本身上训练来推动科学发现 [ADRS Blog #25] 我们介绍 TTT-Discover,一个…
TTT-Discover 是一个框架,它在测试时使用强化学习对单个问题训练大型语言模型,在GPU内核工程中创下新纪录,并改进了数学界限。
利用测试时训练线性化视觉Transformer
本文提出了一种方法,将预训练的Softmax注意力模型转换为线性复杂度的测试时训练(TTT)架构,在显著加速推理的同时,实现了与微调Softmax模型相当的文生图质量。该方法通过对Stable Diffusion 3.5进行线性化得到SD3.5-T^5,在1K分辨率下实现1.32倍加速。
TTPO:测试时策略优化
TTPO引入了一种无标签的测试时训练方法,用于数学推理,通过非对称处理一致和不一致的运行轨迹,达到了与监督学习相当的性能。