揭示语言模型中的潜在推理策略

Hugging Face Daily Papers 论文

摘要

本文提出了一种方法,利用潜变量将语言模型的响应分布分解为结构化的、策略条件化的表示,并通过模型导向的重建目标来解决后验塌陷问题。

一个在推理任务上训练的语言模型 p_θ(y mid x) 学会了通过多种不同的策略来解决问题,但这些策略是隐式的且纠缠在模型的响应分布中。我们研究将给定预训练语言模型的响应分布分解为结构化的、策略条件化的表示的问题。具体来说,我们学习一个潜变量分解 p_θ(y mid x) 表示为 (r_ϕ(z mid x), g_ϕ(y mid x,z)),其中路由函数 r 将每个输入映射到潜策略 z 上的分布,生成器 g 在该策略条件下生成响应。一个关键挑战是,从基础模型初始化的生成器已经代表了 p_θ(y mid x) 而不使用 z。因此标准变分推理不会激励模型通过 z 路由信息,这可能导致严重的后验塌陷形式。为了解决这个问题,我们提出一个变分目标,它测量相对于基础模型响应损失的分数信息增益,并将重建压力集中在基础模型惊喜度高的令牌上,鼓励 z 编码与策略相关的响应变化。我们引入了一个多策略算法任务的基准,并表明该目标能够恢复与不同参考策略对齐的潜代码,同时保持基础模型的响应分布。
查看原文
查看缓存全文

缓存时间: 2026/07/29 19:54

论文页面 - 揭示语言模型中的潜在推理策略

来源:https://huggingface.co/papers/2607.17674 一个在推理任务上训练的语言模型会学习到一种响应分布,该分布混合了多种不同的求解策略,但这些策略在模型的响应分布中仍然是隐式的、纠缠在一起的,没有显式变量来识别或控制生成过程中所使用的策略。

我们研究如何将这种分布分解为一种结构化的、以策略为条件的表示形式,其中潜在变量控制生成策略。关键在于,生成器在初始化时已经代表了目标响应分布,而不使用潜在变量,这导致标准变分推断中出现严重的后验塌陷。

我们通过一种模型导向的重建目标来解决这个问题,该目标将学习聚焦于与策略相关的响应变化。在一个受控基准上,我们的方法恢复出与参考策略对齐且跨输入一致的潜在变量,同时保留了基础模型的响应分布。

相似文章

大规模推理模型(尚)不是多语言潜在推理器

arXiv cs.CL

本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。

解构并引导大型语言模型中的功能性元认知

arXiv cs.CL

本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。