动态潜路由

Hugging Face Daily Papers 论文

摘要

动态潜路由(DLR)让LLM通过搜索组合子策略来学习自己的内心独白,其灵感来源于语言的组合性。在低数据微调场景中,DLR达到或优于标准的监督微调。

我们研究了在具有时变奖励函数的马尔可夫决策过程(MDP)中子策略的时间拼接。我们引入了广义迪杰斯特拉搜索(GDS),并证明通过中间最优子策略的时间组合可以恢复全局最优的目标达成策略。受GDS背后“搜索-选择-更新”原则的启发,我们提出了动态潜路由(DLR),这是一种语言模型后训练方法,通过在单个训练阶段中进行动态搜索,联合学习离散潜编码、路由策略和模型参数。在低数据微调设置中,DLR在四个数据集和六个模型上达到或优于监督微调,平均提升+6.6个百分点,而先前的离散潜基线方法始终低于SFT。机制分析和针对性代码消融实验表明,DLR学习到具有不同因果角色的结构化路由行为。
查看原文
查看缓存全文

缓存时间: 2026/05/15 04:23

论文页面 - Dynamic Latent Routing

来源:https://huggingface.co/papers/2605.14323

人类生活在连续的世界中,却用离散的语言思考。LLM 生活在分词化的世界里,却用连续的表示进行思考。那么,离散语言是否仅仅是一种交流产物?

我们的答案是:不。语言不仅是离散的,它还是组合性的。这种结构让智能体能通过组合来行动学习。“打开门,然后进入房间”将两个策略组合成一个新的。“独角鲸是一种长着角的鲸鱼”通过结合已知概念来教授陌生概念。

我们将这一直觉转化为强化学习定理:利用通用 Dijkstra 搜索,更短的策略可以像语言一样拼接起来,构成达到目标的最优策略。智能体无需从头重新考虑每种情况,而是可以复用已学得的子策略,并在目标变化时搜索这些子策略的可能组合。

受此启发,Dynamic Latent Routing 让 LLM 学会自己的内心独白。每个编码就像模型内部子策略的小型引导信号。DLR 搜索有用的编码,训练模型复用它们,并让编码组合成更长的思维链。在低数据微调场景中,DLR 匹配或超越了 SFT,且学得的编码和 n-gram 分别承担了不同的因果角色。

相似文章

DLLG:LLM专家的动态Logit级门控机制

arXiv cs.CL

DLLG(动态Logit级门控)是一种新颖的框架,通过轻量级可学习门控模块,在token级别的logit空间中动态融合多个专门化LLM,在推理和代码基准测试中超越了路由、启发式集成和参数合并等基线方法。该方法仅需稀疏的响应级监督信号,且在无需重新训练的情况下保留了专家模块的独立性。