动态潜路由
摘要
动态潜路由(DLR)让LLM通过搜索组合子策略来学习自己的内心独白,其灵感来源于语言的组合性。在低数据微调场景中,DLR达到或优于标准的监督微调。
查看缓存全文
缓存时间: 2026/05/15 04:23
论文页面 - Dynamic Latent Routing
来源:https://huggingface.co/papers/2605.14323
人类生活在连续的世界中,却用离散的语言思考。LLM 生活在分词化的世界里,却用连续的表示进行思考。那么,离散语言是否仅仅是一种交流产物?
我们的答案是:不。语言不仅是离散的,它还是组合性的。这种结构让智能体能通过组合来行动和学习。“打开门,然后进入房间”将两个策略组合成一个新的。“独角鲸是一种长着角的鲸鱼”通过结合已知概念来教授陌生概念。
我们将这一直觉转化为强化学习定理:利用通用 Dijkstra 搜索,更短的策略可以像语言一样拼接起来,构成达到目标的最优策略。智能体无需从头重新考虑每种情况,而是可以复用已学得的子策略,并在目标变化时搜索这些子策略的可能组合。
受此启发,Dynamic Latent Routing 让 LLM 学会自己的内心独白。每个编码就像模型内部子策略的小型引导信号。DLR 搜索有用的编码,训练模型复用它们,并让编码组合成更长的思维链。在低数据微调场景中,DLR 匹配或超越了 SFT,且学得的编码和 n-gram 分别承担了不同的因果角色。
相似文章
DLLG:LLM专家的动态Logit级门控机制
DLLG(动态Logit级门控)是一种新颖的框架,通过轻量级可学习门控模块,在token级别的logit空间中动态融合多个专门化LLM,在推理和代码基准测试中超越了路由、启发式集成和参数合并等基线方法。该方法仅需稀疏的响应级监督信号,且在无需重新训练的情况下保留了专家模块的独立性。
超越 LoRA 与全参数微调:基于梯度引导优化器路由的大语言模型适配
本文提出了一种混合 LoRA 与全参数微调(MoLF)框架,利用梯度引导的优化器路由在 LoRA 和全参数微调之间进行自适应切换。旨在通过结合全参数微调的可塑性与 LoRA 的正则化特性,克服仅依赖静态适配方法的结构局限性。
SLMs 作为多智能体路由器:一种渐进式 SFT 与强化学习方法
本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
从采样结果到能力分布:重新思考LLM路由的监督
本文提出DARS,一个从模型行为的分布视角构建路由监督的框架,旨在解决LLM路由中单次标签不可靠的问题。