Test Time Training(3分钟阅读)
摘要
本文讨论了Test Time Training作为AI开发中潜在的新扩展轴,分析了一篇将其定位为线性注意力形式的论文,并探讨了其对模型训练和持续学习的影响。
模型开发中最吸引人的短语之一是'新的扩展轴'。每当行业发现一个新的扩展轴,都会带来模型效果的巨大提升。Test Time Training的想法之所以吸引人,是因为它解锁了一个新的扩展轴。新研究已经发现了一些令人兴奋的技术,但持续学习的问题仍然有待解决。
查看缓存全文
缓存时间: 2026/09/03 23:45
# 测试时训练
来源:https://ianbarber.blog/2026/09/02/test-time-training/
模型开发中最令人兴奋的短语之一是“新缩放维度”。我们已经知道可以通过增大模型来缩放参数,但随后必须相应地缩放数据以最大化其效用。后来我们1 (https://ianbarber.blog/2026/09/02/test-time-training/#d0259c1e-a3b9-47a5-8e4d-39e0ff722263)发现可以独立于浮点运算量来缩放参数。而最近我们意识到,可以通过推理在测试时进行缩放。
每一次这种突破都显著提升了模型效能。从简化的视角看,GPT从1到3版本的演进主要通过数据缩放,MoE架构实现了参数缩放,而自o1以来的所有进展都(同时)实现了测试时计算的缩放。
因此测试时*训练*的理念就显得极具吸引力——这本质上是一个新的缩放维度。它也契合了持续学习的宏观趋势:当前模型智能程度极高,但如果你想让它们避免重复犯同样的低级错误,就必须在提示词中强调“重要:请勿忽视”。如果它们能自主学习,就不需要这样做了!
所以当你看到类似《带KV绑定的测试时训练本质是线性注意力》(https://arxiv.org/abs/2602.21204)这样的论文标题时,可能会觉得这只是将现有概念重新包装:
> 以KV绑定作为序列建模层的测试时训练(TTT)通常被解释为一种在线元学习形式,能在测试时记忆键值映射关系。然而我们的分析发现了多个与这种基于记忆的解释相悖的现象。基于这些发现,我们重新审视了TTT的形式化定义,并证明一类广泛的TTT架构可表达为一种可学习的线性注意力运算符。
需要明确的是,这篇论文很有意思,对构建特定类型模型的从业者来说有不少启示。但我觉得最有趣的是围绕“测试时训练”的概念混杂性。
《分布偏移下的测试时训练》(https://arxiv.org/abs/1909.13231)是定义该术语的开创性论文,其内容符合预期:通过更新模型权重来处理测试时遇到的分布偏移。这些更新针对*慢权重*——由优化器更新、按小批量/检查点频率变化,也就是人们通常理解的“权重”概念。
然后还有*快权重*。它们在正向传播过程中生成,比如线性注意力层中的状态矩阵2 (https://ianbarber.blog/2026/09/02/test-time-training/#85ba9e33-6274-4263-932f-5a912047ed22)。常规训练不会直接优化这些值,而是学习生成它们的规则。
正如你可能猜到的,本文所说的测试时训练正是针对快权重,具体指KV绑定层。它添加了一个不随序列长度增长的矩阵,并对序列中的每个元素执行梯度步骤来更新该矩阵。如果这听起来像线性注意力层或RNN,那么没错,这篇论文正是你的菜!
至于它是否解决了持续学习问题:每个新序列都会重置快权重。所以答案是否定的。
1. Noam↩︎ (https://ianbarber.blog/2026/09/02/test-time-training/#d0259c1e-a3b9-47a5-8e4d-39e0ff722263-link)
2. 我认为此处必须按照规范致敬Schmidhuber↩︎ (https://ianbarber.blog/2026/09/02/test-time-training/#85ba9e33-6274-4263-932f-5a912047ed22-link)
相似文章
当模型学习时(4分钟阅读)
本文解释了测试时训练,即AI模型在推理过程中适应以提高个性化并减少内存使用,但代价是增加每用户计算量。文章讨论了对大规模服务模型的影响,以及在长上下文和用户并发之间的平衡。
测试时计算是否触及天花板?
本文探讨了AI模型在测试时计算扩展带来的收益是否正在减弱,这可能表明当前扩展范式正面临上限。
关于自改进测试时智能的综述:基于反馈的自适应、学习与推理扩展
本综述提出了自改进测试时智能的统一视角,将测试时适应、学习和扩展联系起来,用于AI系统在部署期间使用基于反馈的方法改进其行为。
TEMPO:为大推理模型扩展测试时训练
TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。
A new era of AI testing (2 minute read)
A compilation of Andrej Karpathy's recent tweets covering a minimal GPT implementation, vibe coding an iOS app, and a detailed comparison of GPT-4.5 with earlier models, offering insights into AI testing and scaling.