小型RL控制器与大型语言模型:RL引导的测试时自适应采样
摘要
本文将大型语言模型的自适应采样建模为马尔可夫决策过程,并训练一个轻量级强化学习控制器来平衡正确性、延迟和计算成本,从而实现了更好的权衡。
查看缓存全文
缓存时间: 2026/06/03 07:36
Paper page - Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling
来源:https://huggingface.co/papers/2606.03102
摘要
将大语言模型的自适应采样建模为马尔可夫决策过程,并通过强化学习进行优化,以平衡正确性、延迟和计算成本。
测试时扩展能提升大语言模型(https://huggingface.co/papers?q=large%20language%20models)的推理性能,但会显著增加总计算量和延迟。现有的自适应采样(https://huggingface.co/papers?q=adaptive%20sampling)方法通过动态决定何时停止采样部分缓解了此问题,但通常依赖启发式规则或分布假设。在本工作中,我们将自适应采样(https://huggingface.co/papers?q=adaptive%20sampling)建模为马尔可夫决策过程(https://huggingface.co/papers?q=Markov%20decision%20process)(MDP)。我们使用强化学习(https://huggingface.co/papers?q=reinforcement%20learning)(RL)训练一个轻量级采样控制器,以联合平衡答案正确性、延迟和计算成本。在每一轮中,控制器决定是停止采样还是继续获取更多样本。我们的方法非常轻量,仅依赖最终答案的统计信息,且可在CPU上训练和部署。我们进一步证明,所得框架可被解释为带显式预算约束的约束优化(https://huggingface.co/papers?q=constrained%20optimization)问题的拉格朗日松弛(https://huggingface.co/papers?q=Lagrangian%20relaxation)。实验表明,相较于ASC、ESC等强基线,我们的方法在答案正确性、采样轮次和所需总样本数之间实现了更优的权衡。
查看 arXiv 页面(https://arxiv.org/abs/2606.03102)查看 PDF(https://arxiv.org/pdf/2606.03102)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.03102)
在你的 agent 中获取此论文:
hf papers read 2606\.03102
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2606.03102 以从此页面链接。
引用此论文的数据集0
暂无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.03102 以从此页面链接。
引用此论文的 Spaces0
暂无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.03102 以从此页面链接。
包含此论文的收藏集0
暂无收藏集包含此论文
将论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR
本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。
面向小规模语言模型智能体的稳健强化学习
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。
面向小规模语言模型智能体的鲁棒强化学习
本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。
自信扩展:针对自适应测试时间缩放的LLM置信度校准
本文提出了C3RL,一种在保持准确性的同时校准LLM置信度的强化学习算法,以及CAS,一种基于置信度的自适应测试时缩放策略,可将推理成本降低多达12.33倍。
面向可扩展多任务强化学习的大决策模型
本文介绍了LDM-v0,一个在来自数千个多样强化学习环境的轨迹上离线训练的大决策模型,证明了单一的Transformer策略可以在机器人、自动驾驶、库存管理、网络安全、交易和视频游戏等领域匹配特定任务策略的性能。