Test Time Training(3分钟阅读)

TLDR AI 新闻

摘要

本文讨论了Test Time Training作为AI开发中潜在的新扩展轴,分析了一篇将其定位为线性注意力形式的论文,并探讨了其对模型训练和持续学习的影响。

模型开发中最吸引人的短语之一是'新的扩展轴'。每当行业发现一个新的扩展轴,都会带来模型效果的巨大提升。Test Time Training的想法之所以吸引人,是因为它解锁了一个新的扩展轴。新研究已经发现了一些令人兴奋的技术,但持续学习的问题仍然有待解决。
查看原文
查看缓存全文

缓存时间: 2026/09/03 23:45

# 测试时训练 来源:https://ianbarber.blog/2026/09/02/test-time-training/ 模型开发中最令人兴奋的短语之一是“新缩放维度”。我们已经知道可以通过增大模型来缩放参数,但随后必须相应地缩放数据以最大化其效用。后来我们1 (https://ianbarber.blog/2026/09/02/test-time-training/#d0259c1e-a3b9-47a5-8e4d-39e0ff722263)发现可以独立于浮点运算量来缩放参数。而最近我们意识到,可以通过推理在测试时进行缩放。 每一次这种突破都显著提升了模型效能。从简化的视角看,GPT从1到3版本的演进主要通过数据缩放,MoE架构实现了参数缩放,而自o1以来的所有进展都(同时)实现了测试时计算的缩放。 因此测试时*训练*的理念就显得极具吸引力——这本质上是一个新的缩放维度。它也契合了持续学习的宏观趋势:当前模型智能程度极高,但如果你想让它们避免重复犯同样的低级错误,就必须在提示词中强调“重要:请勿忽视”。如果它们能自主学习,就不需要这样做了! 所以当你看到类似《带KV绑定的测试时训练本质是线性注意力》(https://arxiv.org/abs/2602.21204)这样的论文标题时,可能会觉得这只是将现有概念重新包装: > 以KV绑定作为序列建模层的测试时训练(TTT)通常被解释为一种在线元学习形式,能在测试时记忆键值映射关系。然而我们的分析发现了多个与这种基于记忆的解释相悖的现象。基于这些发现,我们重新审视了TTT的形式化定义,并证明一类广泛的TTT架构可表达为一种可学习的线性注意力运算符。 需要明确的是,这篇论文很有意思,对构建特定类型模型的从业者来说有不少启示。但我觉得最有趣的是围绕“测试时训练”的概念混杂性。 《分布偏移下的测试时训练》(https://arxiv.org/abs/1909.13231)是定义该术语的开创性论文,其内容符合预期:通过更新模型权重来处理测试时遇到的分布偏移。这些更新针对*慢权重*——由优化器更新、按小批量/检查点频率变化,也就是人们通常理解的“权重”概念。 然后还有*快权重*。它们在正向传播过程中生成,比如线性注意力层中的状态矩阵2 (https://ianbarber.blog/2026/09/02/test-time-training/#85ba9e33-6274-4263-932f-5a912047ed22)。常规训练不会直接优化这些值,而是学习生成它们的规则。 正如你可能猜到的,本文所说的测试时训练正是针对快权重,具体指KV绑定层。它添加了一个不随序列长度增长的矩阵,并对序列中的每个元素执行梯度步骤来更新该矩阵。如果这听起来像线性注意力层或RNN,那么没错,这篇论文正是你的菜! 至于它是否解决了持续学习问题:每个新序列都会重置快权重。所以答案是否定的。 1. Noam↩︎ (https://ianbarber.blog/2026/09/02/test-time-training/#d0259c1e-a3b9-47a5-8e4d-39e0ff722263-link) 2. 我认为此处必须按照规范致敬Schmidhuber↩︎ (https://ianbarber.blog/2026/09/02/test-time-training/#85ba9e33-6274-4263-932f-5a912047ed22-link)

相似文章

当模型学习时(4分钟阅读)

TLDR AI

本文解释了测试时训练,即AI模型在推理过程中适应以提高个性化并减少内存使用,但代价是增加每用户计算量。文章讨论了对大规模服务模型的影响,以及在长上下文和用户并发之间的平衡。

测试时计算是否触及天花板?

Reddit r/AI_Agents

本文探讨了AI模型在测试时计算扩展带来的收益是否正在减弱,这可能表明当前扩展范式正面临上限。

TEMPO:为大推理模型扩展测试时训练

Hugging Face Daily Papers

TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。

A new era of AI testing (2 minute read)

TLDR AI

A compilation of Andrej Karpathy's recent tweets covering a minimal GPT implementation, vibe coding an iOS app, and a detailed comparison of GPT-4.5 with earlier models, offering insights into AI testing and scaling.