揭示语言模型中的潜在推理策略
摘要
本文提出了一种方法,利用潜变量将语言模型的响应分布分解为结构化的、策略条件化的表示,并通过模型导向的重建目标来解决后验塌陷问题。
查看缓存全文
缓存时间: 2026/07/29 19:54
论文页面 - 揭示语言模型中的潜在推理策略
来源:https://huggingface.co/papers/2607.17674 一个在推理任务上训练的语言模型会学习到一种响应分布,该分布混合了多种不同的求解策略,但这些策略在模型的响应分布中仍然是隐式的、纠缠在一起的,没有显式变量来识别或控制生成过程中所使用的策略。
我们研究如何将这种分布分解为一种结构化的、以策略为条件的表示形式,其中潜在变量控制生成策略。关键在于,生成器在初始化时已经代表了目标响应分布,而不使用潜在变量,这导致标准变分推断中出现严重的后验塌陷。
我们通过一种模型导向的重建目标来解决这个问题,该目标将学习聚焦于与策略相关的响应变化。在一个受控基准上,我们的方法恢复出与参考策略对齐且跨输入一致的潜在变量,同时保留了基础模型的响应分布。
相似文章
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
大规模推理模型(尚)不是多语言潜在推理器
本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。
我们能理解大语言模型是如何推理的吗?
本文探讨了理解大语言模型推理方式的现有努力和挑战,重点关注可解释性研究。
解构并引导大型语言模型中的功能性元认知
本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。
揭示大语言模型中的数学推理:内部机制的方法学研究
本文通过早期解码分析大语言模型的内部机制,研究其如何执行算术运算。研究发现,能力强的模型在推理任务中,注意力模块和 MLP 模块之间呈现明确的分工。