通过自适应循环Transformer改进测试时缩放
摘要
本文介绍了TaH2,一种自适应循环Transformer,通过动态分配额外迭代给有益的token来改进测试时缩放,在AIME等基准测试上实现了比基线53%的准确度-计算斜率提升。
查看缓存全文
缓存时间: 2026/09/29 08:19
论文页面 - 采用自适应循环Transformer提升测试时缩放能力
来源:https://huggingface.co/papers/2609.35748
摘要
循环Transformer通过复用层进行潜在计算,展现出优异的参数效率。现有研究在相同参数量或每令牌FLOPs条件下比较了循环与非循环模型。但据我们所知,循环机制在输出序列增长时对测试时缩放能力的提升效果尚未得到充分探索。通过对循环Transformer进行后训练,我们研究了准确率-计算斜率(即测试时解码FLOPs每翻倍带来的准确率增益)。研究发现,现有的循环Transformer往往比非循环基线模型呈现更陡峭的斜率,但在匹配计算量时表现更差。由于固定深度循环会在每个令牌上消耗额外迭代,我们的分析表明许多令牌并未从额外迭代中获益。因此我们提出TaH2,使模型能够将额外迭代聚焦于受益于循环的令牌。该方法通过前瞻深度监督联合训练骨干网络与迭代决策器,其中包含指示进一步迭代是否能改善预测的在线标签。TaH2同时提升了测试时缩放的效率和可达准确率。在具有挑战性的AIME基准测试中,TaH2将准确率-计算斜率相比非循环基线提升了53%(2.74 vs. 1.79),在匹配测试时计算量时超出基线峰值准确率约3.4个百分点。随着最大迭代深度增加,现有循环模型大多趋于平稳,而TaH2相对于非循环基线的增益持续增长,从深度2时的+2.8分提升至深度8时的+3.9分。我们的代码已开源:https://github.com/thu-nics/TaH。
查看arXiv页面 (https://arxiv.org/abs/2609.35748)查看PDF (https://arxiv.org/pdf/2609.35748)项目页面 (https://fuvty.github.io/thinking_yard_project_page/projects/tah2/)GitHub 85 (https://github.com/thu-nics/TaH)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.35748)
通过智能助手获取此论文:
hf papers read 2609.35748
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文 在模型README.md中引用arxiv.org/abs/2609.35748可将模型链接至本页面。
引用本文的数据集0
无数据集链接本文 在数据集README.md中引用arxiv.org/abs/2609.35748可将数据集链接至本页面。
引用本文的Space0
无Space链接本文 在Space README.md中引用arxiv.org/abs/2609.35748可将Space链接至本页面。
包含本文的收藏集0
无收藏集包含本文 将本文添加至收藏集 (https://huggingface.co/new-collection)可将其链接至本页面。
相似文章
LoopCoder-v2:仅一次循环实现高效的测试时计算扩展
LoopCoder-v2 提出了并行循环变换器(Parallel Loop Transformers,PLT),用于在代码生成中实现高效的测试时计算扩展,证明两次循环能带来显著增益,而更多循环则导致收益递减和位置错位成本。
代理式测试时扩展(GitHub 仓库)
AutoTTS 是一个开源工具,它利用代理发现机制,自动为大型语言模型(LLM)寻找最优的测试时扩展策略,通过基于重放的评估显著降低 token 消耗和成本。
DeepLoop:循环Transformer的深度缩放
DeepLoop为循环Transformer引入了一种残差缩放方法,该方法根据参数访问进行调整,从而在物理块跨多轮重用时提高稳定性和性能。
通过自适应张量并行加速同步RLHF训练中的长尾生成
本文提出PAT,一种自适应张量并行方法,在同步RLHF训练的生成长阶段动态重构TP配置,以缓解长尾生成瓶颈。在LLaMA3.1-8B和Qwen3-14B上的评估显示,生成延迟最多降低34.6%,端到端迭代延迟最多降低27.2%。
用 LLM 优化 LLM:面向测试时扩展的智能体发现方法
本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。