揭示语言模型中的潜在推理策略
摘要
本文提出了一种方法,利用潜变量将语言模型的响应分布分解为结构化的、策略条件化的表示,并通过模型导向的重建目标来解决后验塌陷问题。
查看缓存全文
缓存时间: 2026/07/29 19:54
论文页面 - 揭示语言模型中的潜在推理策略
来源:https://huggingface.co/papers/2607.17674 一个在推理任务上训练的语言模型会学习到一种响应分布,该分布混合了多种不同的求解策略,但这些策略在模型的响应分布中仍然是隐式的、纠缠在一起的,没有显式变量来识别或控制生成过程中所使用的策略。
我们研究如何将这种分布分解为一种结构化的、以策略为条件的表示形式,其中潜在变量控制生成策略。关键在于,生成器在初始化时已经代表了目标响应分布,而不使用潜在变量,这导致标准变分推断中出现严重的后验塌陷。
我们通过一种模型导向的重建目标来解决这个问题,该目标将学习聚焦于与策略相关的响应变化。在一个受控基准上,我们的方法恢复出与参考策略对齐且跨输入一致的潜在变量,同时保留了基础模型的响应分布。
相似文章
潜在推理模型是否易于解释?
该论文研究了潜在推理模型的可解释性,发现推理令牌通常不是必要的,但在需要时可以被解码以显示可解释的痕迹,表明这些模型实现了预期的解决方案。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
大规模推理模型(尚)不是多语言潜在推理器
本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。
基于强化学习后训练的语言模型组合推理
本文提出一个依赖图框架以形式化语言模型中的组合推理,并评估强化学习后训练的影响,发现了一种不对称性:组合技能训练向分解任务的迁移比反向更为容易。
在潜在空间中思考,在语言中解释:自解释潜在推理
本文介绍了SELR,一个统一的自解释潜在推理框架,它训练单个模型以执行高效推理,同时生成人类可读的解释,从而消除了对外部解码器的需要。