TEMPO:为大推理模型扩展测试时训练
摘要
TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。
查看缓存全文
缓存时间: 2026/04/22 06:17
TEMPO:面向大型推理模型的测试时训练规模化
来源:https://huggingface.co/papers/2604.19295
摘要
TEMPO 是一种测试时训练框架,通过交替策略优化与评论器再校准,在避免多样性坍缩的同时,持续为语言模型带来性能提升。
测试时训练(Test-time training,TTT)在推理阶段利用无标签测试样本实时调整模型参数,使能力持续突破离线训练的上限。然而,现有面向 LRM 的 TTT 方法很快陷入平台期,无法随测试时算力增加而继续受益。缺乏外部校准时,随着策略模型演化,自生成的奖励信号逐渐漂移,导致性能停滞并出现多样性坍缩。我们提出 TEMPO,该 TTT 框架在无标签题目上进行策略优化,并周期性地在带标签数据集上执行评论器再校准。通过期望最大化(EM)算法形式化这一交替过程,我们发现先前方法均可视为省略了关键再校准步骤的不完全版本。重新引入该步骤可收紧证据下界(ELBO),从而实现持续提升。在 Qwen3 与 OLMO3 等不同模型家族及多种推理任务上,TEMPO 将 OLMO3-7B 在 AIME 2024 的准确率从 33.0% 提升至 51.1%,Qwen3-14B 从 42.3% 提升至 65.8%,同时保持高多样性。
查看 arXiv 页面(https://arxiv.org/abs/2604.19295)
查看 PDF(https://arxiv.org/pdf/2604.19295)
项目主页(https://qingyangzhang.github.io/tempo-homepage)
GitHub(https://github.com/QingyangZhang/TEMPO)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.19295)
在智能体中获取该论文:
hf papers read 2604.19295
未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型引用
在模型 README.md 中引用 arxiv.org/abs/2604.19295,即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集引用
在数据集 README.md 中引用 arxiv.org/abs/2604.19295,即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 引用
在 Space README.md 中引用 arxiv.org/abs/2604.19295,即可在此页面显示链接。
收录该论文的合集 1
相似文章
TEMPO:通过模式分离策略优化实现时间强制,用于可信的大语言模型回测
提出TEMPO,一种策略优化方法,通过使用双模式奖励和基于GRPO的训练,训练大语言模型仅依据截止日期前的信息进行推理,将知识泄露降低2–13%,同时将任务性能提升6–13%。
REVES: REVES:修订与验证增强的测试时扩展训练
提出REVES,一种两阶段迭代框架,交替进行数据增强与策略优化,通过利用中间修正步骤提升LLM推理能力,在编程基准测试和约束满足问题上取得更优性能。
我训练了TIME:基于Qwen模型的短时上下文触发思考而非过度思考
一个个人项目最终产出了一篇ACL 2026论文,介绍了TIME方法,训练Qwen3模型进行短时、上下文触发的思考,而非过度推理。该工作使用了QLoRA和四阶段课程,所有数据和代码均已开源发布。
TMAS:通过多智能体协同扩展测试时计算
TMAS 引入了一种多智能体框架,通过结构化协作与分层记忆系统扩展测试时计算,从而增强大语言模型的推理能力。该方法采用专用智能体、跨轨迹信息流以及混合奖励强化学习,有效提升了模型在复杂推理基准上的迭代扩展性能与稳定性。
ThinkBooster: 用于LLM推理的无缝测试时计算扩展的统一框架
ThinkBooster是一个用于LLM推理的测试时计算扩展的统一框架,提供了模块化Python库、性能-效率基准、兼容OpenAI的代理服务以及可视化调试器。在数学和编程任务上的实证结果展示了实际收益以及质量-成本权衡。