TEMPO:为大推理模型扩展测试时训练

Hugging Face Daily Papers 论文

摘要

TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。

测试时训练(TTT)在推理阶段利用无标签测试样本在线更新模型参数,可持续突破离线训练的能力边界。然而,现有面向大推理模型(LRM)的 TTT 方法很快陷入平台期,无法随测试时算力增加而继续受益。缺乏外部校准时,自生成的奖励信号会随着策略模型演化而逐渐漂移,导致性能停滞与多样性崩塌。我们提出 TEMPO,一种 TTT 框架:在无标签题目上微调策略,并周期性地在带标签数据集上重新校准评判器。通过期望-最大化(EM)算法形式化这一交替过程,我们发现此前的方法均可视为省略了关键再校准步骤的不完整变体。重新引入该步骤可收紧证据下界(ELBO),实现持续改进。在 Qwen3、OLMO3 等不同模型家族及多种推理任务上,TEMPO 将 OLMO3-7B 在 AIME 2024 的得分从 33.0% 提升至 51.1%,Qwen3-14B 从 42.3% 提升至 65.8%,同时保持高多样性。
查看原文
查看缓存全文

缓存时间: 2026/04/22 06:17

TEMPO:面向大型推理模型的测试时训练规模化

来源:https://huggingface.co/papers/2604.19295

摘要

TEMPO 是一种测试时训练框架,通过交替策略优化与评论器再校准,在避免多样性坍缩的同时,持续为语言模型带来性能提升。

测试时训练(Test-time training,TTT)在推理阶段利用无标签测试样本实时调整模型参数,使能力持续突破离线训练的上限。然而,现有面向 LRM 的 TTT 方法很快陷入平台期,无法随测试时算力增加而继续受益。缺乏外部校准时,随着策略模型演化,自生成的奖励信号逐渐漂移,导致性能停滞并出现多样性坍缩。我们提出 TEMPO,该 TTT 框架在无标签题目上进行策略优化,并周期性地在带标签数据集上执行评论器再校准。通过期望最大化(EM)算法形式化这一交替过程,我们发现先前方法均可视为省略了关键再校准步骤的不完全版本。重新引入该步骤可收紧证据下界(ELBO),从而实现持续提升。在 Qwen3 与 OLMO3 等不同模型家族及多种推理任务上,TEMPO 将 OLMO3-7B 在 AIME 2024 的准确率从 33.0% 提升至 51.1%,Qwen3-14B 从 42.3% 提升至 65.8%,同时保持高多样性。

查看 arXiv 页面(https://arxiv.org/abs/2604.19295)
查看 PDF(https://arxiv.org/pdf/2604.19295)
项目主页(https://qingyangzhang.github.io/tempo-homepage)
GitHub(https://github.com/QingyangZhang/TEMPO)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.19295)

在智能体中获取该论文:

hf papers read 2604.19295

未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

暂无模型引用

在模型 README.md 中引用 arxiv.org/abs/2604.19295,即可在此页面显示链接。

引用该论文的数据集 0

暂无数据集引用

在数据集 README.md 中引用 arxiv.org/abs/2604.19295,即可在此页面显示链接。

引用该论文的 Spaces 0

暂无 Space 引用

在 Space README.md 中引用 arxiv.org/abs/2604.19295,即可在此页面显示链接。

收录该论文的合集 1

相似文章

TMAS:通过多智能体协同扩展测试时计算

Hugging Face Daily Papers

TMAS 引入了一种多智能体框架,通过结构化协作与分层记忆系统扩展测试时计算,从而增强大语言模型的推理能力。该方法采用专用智能体、跨轨迹信息流以及混合奖励强化学习,有效提升了模型在复杂推理基准上的迭代扩展性能与稳定性。