早期编码,晚期使用:Transformer如何在对话中处理推断出的伙伴专业知识

Hugging Face Daily Papers 论文

摘要

本文表明,Transformer模型在早期层编码对话伙伴的专业知识,但仅在后期层才在因果上激活它,这揭示了一个限制多轮对话中引导模型行为的干预点的间隙。

Transformer可以在其残差流中使某个属性在深度上可线性解码,即使该属性尚未影响输出。对于直接在输入中声明的属性,信息可读位置与使用位置之间的这种差距已被证实。我们探究这是否也适用于模型必须在对话中逐渐推断的属性,即对话伙伴的专业程度。使用ExpertCollab——一个由模型扮演的四种专业水平角色之间的多轮研究规划对话语料库——我们发现伙伴专业知识在早期层最可解码,并在网络中点前下降到接近随机水平。反事实修补显示,在峰值可解码层注入专业知识差异几乎不会改变固定的后期层读出,而在中点后注入相同差异几乎完全传播,差异超过一个数量级。一个内容匹配的随机控制和一个无探针诊断将过渡置于同一早期层,而一个静态指定的控制属性在整个过程中保持可解码。因此,一个推断的关系属性在变得因果活跃之前就已被很好地表示,这限制了任何尝试读出或引导伙伴条件行为必须干预的位置。我们使用一个模型在合成语料库上进行初步演示。
查看原文
查看缓存全文

缓存时间: 2026/09/09 08:29

论文页面 - 提前编码,延迟使用:Transformer何时开始基于推断的对话伙伴专长采取行动

来源:https://huggingface.co/papers/2609.07139

摘要

在多轮对话中,模型对对话伙伴专长的推断在早期层即可读取,但仅在后期层才实际产生因果影响,这为引导行为的干预点设定了范围。

Transformer(https://huggingface.co/papers?q=transformer)能够在残差流(https://huggingface.co/papers?q=residual%20stream)的某一深度使某个属性可被线性解码,而此时该属性尚未影响输出。这种信息可读位置与实际使用位置之间的差距,已在直接输入于输入内容中的属性上得到证实。我们探究对于模型需在对话中逐渐推断的属性——即对话伙伴的专业水平——是否同样存在这种现象。使用ExpertCollab语料库(包含模型扮演的四种专业水平角色之间的多轮研究规划对话),我们发现对话伙伴的专长在早期层最易被解码,且在网络中点之前就已降至近似随机水平。反事实修补(https://huggingface.co/papers?q=Counterfactual%20patching)显示,在可解码性峰值层注入专长差异几乎不会改变固定的后期层读出结果,而同样差异在网络中点之后注入则几乎能完全传播,差异超过一个数量级。通过内容匹配的随机对照和无探测器诊断(https://huggingface.co/papers?q=probe-free%20diagnostic)将该转折点定位于相同的早期层,而静态指定的对照属性则始终可被解码。因此,一个推断的关系型属性(https://huggingface.co/papers?q=relational%20attribute)在其产生因果影响之前就已得到充分表征,这为任何试图读出或引导基于伙伴条件的行为设定了干预位置的界限。我们使用单个模型在合成语料库上进行了初步演示。

查看arXiv页面 (https://arxiv.org/abs/2609.07139) 查看PDF (https://arxiv.org/pdf/2609.07139) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.07139)

在您的智能体中获取此论文: hf papers read 2609\.07139

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

尚无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.07139以从此页面链接。

引用此论文的数据集0

尚无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.07139以从此页面链接。

引用此论文的Space0

尚无Space链接此论文

在Space README.md中引用arxiv.org/abs/2609.07139以从此页面链接。

包含此论文的合集0

尚无合集包含此论文

将此论文添加至合集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

Transformer语言模型中情境建模与心理化的发育轨迹

arXiv cs.CL

本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。

硬决策层:Transformers中承诺推理的证据

arXiv cs.CL

本文识别了Transformer语言模型中的硬决策层(HDL),即在推理过程中答案选项排名突然稳定的架构特性,并证明其对微调具有不变性,且在多个模型和数据集上一致。

一种新 Transformer 将隐状态传递给下一个 token 而非重新计算(25 分钟阅读)

TLDR AI

论文提出了 LIFT(Latent Information Feedback Transformer),它在生成步骤之间传播深层隐状态,而不是仅依赖已解码的 token,采用 teacher-forced 预训练方式,其状态由现成语言模型的下一个 token 分布生成。在 135M–1B 参数模型上的实验表明,在 token 预算对齐的条件下,LIFT 在语言建模、推理和程序性任务上均优于标准 Transformer,代码和模型均已开源。