标签
本文介绍了一种强化学习方法,用于训练一个元推理策略,该策略基于响应式策略的不确定性,在快速的响应式控制与较慢的深思熟虑规划之间进行选择,从而在导航任务中实现更好的平衡与适应性。
HALO 提出了一种针对冻结语言模型的混合自适应潜在精炼方法,该方法选择性地对一部分 token 应用第二阶段精炼,在计算量更少的情况下实现了比固定精炼步骤更好的性能。
Looped World Models 通过共享的Transformer块引入迭代潜在状态细化,实现了100倍的参数效率,同时根据预测复杂度自适应调整计算深度。
提出了AdaSR框架,使推理模型能够自适应地处理流式输入,以及HRPO(一种分层强化学习方法),用于优化思考分配,以实现准确性与效率的权衡。
DeepMind研究员Brendan O'Donoghue深入介绍文本扩散模型,通过迭代去噪生成文本,相比自回归模型延迟更低但吞吐量受限,并展示自修正和动态计算等独特优势。
Light Interaction 提出了一种用于交互式视频世界模型的无训练推理加速框架,采用自适应上下文管理、去噪缓存加速和3D块稀疏注意力,实现了高达2.59倍的速度提升,同时保持了有竞争力的视觉质量。
本文提出了Token-Selective Attention (TSA),一种可微的token路由机制,它学习在每个token上跳过Transformer层中不必要的计算,从而在语言建模任务中将token层操作减少14-23%,且质量损失极小。