早期编码,晚期使用:Transformer如何在对话中处理推断出的伙伴专业知识
摘要
本文表明,Transformer模型在早期层编码对话伙伴的专业知识,但仅在后期层才在因果上激活它,这揭示了一个限制多轮对话中引导模型行为的干预点的间隙。
查看缓存全文
缓存时间: 2026/09/09 08:29
论文页面 - 提前编码,延迟使用:Transformer何时开始基于推断的对话伙伴专长采取行动
来源:https://huggingface.co/papers/2609.07139
摘要
在多轮对话中,模型对对话伙伴专长的推断在早期层即可读取,但仅在后期层才实际产生因果影响,这为引导行为的干预点设定了范围。
Transformer(https://huggingface.co/papers?q=transformer)能够在残差流(https://huggingface.co/papers?q=residual%20stream)的某一深度使某个属性可被线性解码,而此时该属性尚未影响输出。这种信息可读位置与实际使用位置之间的差距,已在直接输入于输入内容中的属性上得到证实。我们探究对于模型需在对话中逐渐推断的属性——即对话伙伴的专业水平——是否同样存在这种现象。使用ExpertCollab语料库(包含模型扮演的四种专业水平角色之间的多轮研究规划对话),我们发现对话伙伴的专长在早期层最易被解码,且在网络中点之前就已降至近似随机水平。反事实修补(https://huggingface.co/papers?q=Counterfactual%20patching)显示,在可解码性峰值层注入专长差异几乎不会改变固定的后期层读出结果,而同样差异在网络中点之后注入则几乎能完全传播,差异超过一个数量级。通过内容匹配的随机对照和无探测器诊断(https://huggingface.co/papers?q=probe-free%20diagnostic)将该转折点定位于相同的早期层,而静态指定的对照属性则始终可被解码。因此,一个推断的关系型属性(https://huggingface.co/papers?q=relational%20attribute)在其产生因果影响之前就已得到充分表征,这为任何试图读出或引导基于伙伴条件的行为设定了干预位置的界限。我们使用单个模型在合成语料库上进行了初步演示。
查看arXiv页面 (https://arxiv.org/abs/2609.07139) 查看PDF (https://arxiv.org/pdf/2609.07139) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.07139)
在您的智能体中获取此论文:
hf papers read 2609\.07139
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
尚无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.07139以从此页面链接。
引用此论文的数据集0
尚无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.07139以从此页面链接。
引用此论文的Space0
尚无Space链接此论文
在Space README.md中引用arxiv.org/abs/2609.07139以从此页面链接。
包含此论文的合集0
尚无合集包含此论文
将此论文添加至合集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
Transformer语言模型中情境建模与心理化的发育轨迹
本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。
现代 Transformer 是隐式的混合体:从功能分化到原则性混合架构设计
本文提出了基于干预的指标,以区分 RoPE Transformer 中的检索头和位置头,从而推导出一种原则性混合架构 (HwH),该架构结合了全注意力和线性注意力,以改善语言建模和长上下文外推。
@lateinteraction: “训练框架”开始与神经架构模糊,在谁承载实现泛化的归纳偏差方面…
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。
硬决策层:Transformers中承诺推理的证据
本文识别了Transformer语言模型中的硬决策层(HDL),即在推理过程中答案选项排名突然稳定的架构特性,并证明其对微调具有不变性,且在多个模型和数据集上一致。
一种新 Transformer 将隐状态传递给下一个 token 而非重新计算(25 分钟阅读)
论文提出了 LIFT(Latent Information Feedback Transformer),它在生成步骤之间传播深层隐状态,而不是仅依赖已解码的 token,采用 teacher-forced 预训练方式,其状态由现成语言模型的下一个 token 分布生成。在 135M–1B 参数模型上的实验表明,在 token 预算对齐的条件下,LIFT 在语言建模、推理和程序性任务上均优于标准 Transformer,代码和模型均已开源。