small-rl-controller

标签

Cards List
#small-rl-controller

小型RL控制器与大型语言模型:RL引导的测试时自适应采样

Hugging Face Daily Papers · 2026-06-02 缓存

本文将大型语言模型的自适应采样建模为马尔可夫决策过程,并训练一个轻量级强化学习控制器来平衡正确性、延迟和计算成本,从而实现了更好的权衡。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈