模块化TTT:将测试时训练重新构想为可组合模块

Hugging Face Daily Papers 论文

摘要

本文介绍了模块化TTT,这是一个将测试时训练的内部学习器表示为有向无环图的框架,能够对组件进行系统的消融和组合。作者在1000亿个token上训练了4.1亿和14.5亿参数规模的模型,取得了与GatedDeltaNet相当的性能。

测试时训练(TTT)将序列建模视为一个在线学习问题,其中快速权重通过内部学习规则进行更新。尽管TTT变体越来越多,现有方法通常将每个变体单独硬编码,这使得设计新的TTT方法和隔离每个组件的作用变得困难。为了解决这个问题,我们提出了模块化TTT,这是一个将内部学习器表示为有向无环图,并将快速权重网络、损失函数、学习率、权重衰减和归一化作为显式设计维度的框架。模块化TTT自动将原始级别的训练视图前向、训练视图反向和因果查询视图规则组合成完整的图级TTT计算,包括快速权重状态转换。使用模块化TTT,我们系统地消融了TTT的组件,发现小的学习率初始化、权重衰减和单层非线性能够提升性能,而MSE和内积损失的表现相似。更深的快速权重网络和归一化往往会损害性能,因为它们会导致过大的激活值,而残差连接和门控几乎没有带来可衡量的收益。在这些发现的指导下,我们在1000亿个token上训练了最佳变体,参数量分别为4.1亿和14.5亿,并观察到训练损失和基准性能与Gated DeltaNet相当。
查看原文
查看缓存全文

缓存时间: 2026/08/10 06:14

论文页面 - Modular TTT: 将测试时训练重新思考为可组合模块

来源:https://huggingface.co/papers/2608.07110

摘要

测试时训练(TTT)将序列建模视为一个在线学习问题,其中快速权重通过内部学习规则进行更新。尽管 TTT 变体的数量不断增长,现有方法通常将每种变体单独硬编码,这使得设计新的 TTT 方法以及隔离每个组件的作用变得困难。为了解决这个问题,我们提出了 Modular TTT,一个将内部学习器表示为有向无环图的框架,并将快速权重网络、损失函数、学习率、权重衰减和归一化暴露为显式的设计维度。Modular TTT 自动将原始级别的训练视角前向传播、训练视角反向传播和因果查询视角规则组合成完整的图级 TTT 计算,包括快速权重状态转换。使用 Modular TTT,我们系统性地消融了 TTT 的各个组件,发现较小的学习率初始化、权重衰减和单层非线性能够提升性能,而 MSE 和内积损失的表现相似。更深的快速权重网络和归一化往往会损害性能,因为它们会导致过大的激活值,而残差连接和门控带来的可测量收益很小。在这些发现的指导下,我们将最佳变体训练为 410M 和 1.45B 参数的模型,在 100B tokens 上训练,并观察到训练损失和基准性能与 Gated DeltaNet 相当。

查看 arXiv 页面 (https://arxiv.org/abs/2608.07110)查看 PDF (https://arxiv.org/pdf/2608.07110)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.07110)

在你的 agent 中获取这篇论文:

hf papers read 2608\.07110

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接到这篇论文

在模型 README.md 中引用 arxiv.org/abs/2608.07110 以将其链接到此页面。

引用该论文的数据集0

没有数据集链接到这篇论文

在数据集 README.md 中引用 arxiv.org/abs/2608.07110 以将其链接到此页面。

引用该论文的 Space0

没有 Space 链接到这篇论文

在 Space README.md 中引用 arxiv.org/abs/2608.07110 以将其链接到此页面。

包含该论文的收藏1

相似文章

测试时训练破坏安全护栏

arXiv cs.LG

本文识别了测试时训练(TTT)的三种威胁模型,攻击者可利用这些模型绕过LLM的安全过滤器,实现高攻击成功率。研究结果表明,TTT引入了新的漏洞,破坏了现有的安全护栏。

利用测试时训练线性化视觉Transformer

Hugging Face Daily Papers

本文提出了一种方法,将预训练的Softmax注意力模型转换为线性复杂度的测试时训练(TTT)架构,在显著加速推理的同时,实现了与微调Softmax模型相当的文生图质量。该方法通过对Stable Diffusion 3.5进行线性化得到SD3.5-T^5,在1K分辨率下实现1.32倍加速。

TTPO:测试时策略优化

Hugging Face Daily Papers

TTPO引入了一种无标签的测试时训练方法,用于数学推理,通过非对称处理一致和不一致的运行轨迹,达到了与监督学习相当的性能。