长上下文大语言模型的自引导测试时训练

Hugging Face Daily Papers 论文

摘要

提出了自引导测试时训练(S-TTT)方法,模型在长上下文中识别相关证据片段进行自适应,在长上下文推理基准上实现了高达15%的相对改进。

长上下文处理对于大语言模型(LLM)变得越来越重要,但仅仅扩展上下文窗口并不能保证有效利用长输入。随着输入长度的增加,准确率往往会下降,这表明模型仍然难以识别和使用与问题最相关的证据。一种改善长上下文利用的有前景的方法是测试时训练(TTT),该方法将测试上下文视为训练示例,进行实例特定的参数自适应。然而,将TTT应用于整个长上下文的成本过高,而在随机采样的片段上进行自适应则会引入严重噪声。由于长上下文中的大部分片段与特定问题无关,在这些片段上进行训练甚至可能降低基础模型的性能。我们的初步研究表明,TTT对训练片段的质量高度敏感:在LongBench-v2上,对随机采样片段进行TTT会损害性能,而对最优片段进行TTT则能显著提升性能。受此启发,我们提出了一种简单的方法——自引导测试时训练(S-TTT):在自适应之前,模型识别出应该学习的证据片段,并仅对这些选定的片段应用标准语言建模训练目标。在两个具有挑战性的长上下文推理基准LongBench-v2和LongBench-Pro上,S-TTT提高了Qwen3-4B-Thinking-2507和Llama-3.1-8B-Instruct的准确率,实现了高达15%的相对改进。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:50

Paper page - Self-Guided Test-Time Training for Long-Context LLMs

来源: https://huggingface.co/papers/2607.09415 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

长上下文处理对于大型语言模型(LLMs)正变得越来越重要,但简单地扩展上下文窗口并不能确保对长输入的有效利用。随着输入长度增加,准确率往往会下降,这表明模型在识别和使用与问题最相关的证据方面仍然存在困难。提升长上下文利用的一种有前途的方法是测试时训练(Test-Time Training,TTT),它将测试上下文视为一个训练示例,用于进行针对特定实例的参数适配。然而,对整个长上下文应用 TTT 代价过高,而在随机采样的片段上进行适配则会引入严重的噪声。由于长上下文中的大部分片段与特定问题无关,在这些片段上训练甚至可能损害基模型的性能。我们的初步研究显示,TTT 对训练片段的质量高度敏感:在 LongBench-v2 上,随机采样片段进行 TTT 会损害性能,而在 oracle 片段上进行 TTT 则能显著提升效果。基于此,我们提出了一种简单的方法——自引导测试时训练(Self-Guided TTT, S-TTT):在适配之前,模型先识别出应该学习的证据片段,并仅对这些选中的片段应用标准的语言建模训练目标。在两个具有挑战性的长上下文推理基准 LongBench-v2 和 LongBench-Pro 上,S-TTT 同时提升了 Qwen3-4B-Thinking-2507 和 Llama-3.1-8B-Instruct 的准确率,最高实现了 15% 的相对提升。

查看 arXiv 页面 (https://arxiv.org/abs/2607.09415)查看 PDF (https://arxiv.org/pdf/2607.09415)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09415)

在您的 agent 中获取本文:

hf papers read 2607.09415

还没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

没有模型链接本文

请在模型的 README.md 中引用 arxiv.org/abs/2607.09415,以便从此页面链接。

引用本文的数据集0

没有数据集链接本文

请在数据集的 README.md 中引用 arxiv.org/abs/2607.09415,以便从此页面链接。

引用本文的 Spaces0

没有 Space 链接本文

请在 Space 的 README.md 中引用 arxiv.org/abs/2607.09415,以便从此页面链接。

包含本文的收藏集0

没有收藏集包含本文

请将本文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。

相似文章

用 LLM 优化 LLM:面向测试时扩展的智能体发现方法

Hugging Face Daily Papers

本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。

模块化TTT:将测试时训练重新构想为可组合模块

Hugging Face Daily Papers

本文介绍了模块化TTT,这是一个将测试时训练的内部学习器表示为有向无环图的框架,能够对组件进行系统的消融和组合。作者在1000亿个token上训练了4.1亿和14.5亿参数规模的模型,取得了与GatedDeltaNet相当的性能。

长上下文LLM中的位置失败:推理基准测试的盲点

arXiv cs.CL

本论文识别出长上下文LLM推理基准测试中的一个盲点:它们未能控制任务在上下文中的位置,导致位置失败未被检测到。作者提出上下文旋转评估(CRE)来系统地改变任务位置、填充内容和上下文长度,揭示出当推理任务放置在长上下文中时,某些模型的准确率会严重下降。