Found in Conversation: LLMs 自我学习以缩小多轮对话差距
摘要
本文介绍了 Found in Conversation (FiC),一个使用视图非对称自蒸馏(View-Asymmetric Self-Distillation)的训练框架,旨在缩小 LLMs 中的多轮对话性能差距。该方法教会模型从欠详细的多轮提示中恢复单轮能力,在多种模型系列和规模上实现了 92-100% 的恢复率。
查看缓存全文
缓存时间: 2026/05/26 09:02
# 对话中发现:大语言模型自学弥补多轮对话差距 来源:https://arxiv.org/html/2605.24432 ###### 摘要 大语言模型(LLM)的交互通常是欠指定的,用户需要在多个对话轮次中澄清所有必要细节。然而,近期研究表明,LLM 在多轮设置下的表现远不如单轮——即同一信息一次性给出时,这一现象被称为“对话迷失(Lost-in-Conversation)”。然而,如何有效弥合这一差距仍是一个开放问题。本文提出 **对话中发现(Found in Conversation,FiC)** ,一种训练框架,让模型在欠指定的多轮提示中自学发现并恢复其单轮能力。我们开发了 **视图非对称自蒸馏(View-Asymmetric Self-Distillation,VASD)** ,该方法在同一任务信息的两种视图上执行蒸馏——教师使用单轮视图,学生使用多轮视图——将强大的单轮行为迁移到薄弱的多轮行为中。这不需要更强的外部教师,因为即使是前沿LLM也存在这一差距。在不同模型家族(Llama、Qwen、Phi 和 OLMo)及规模(3B–14B)上,FiC 恢复了至少92%的单轮性能,并在两个 Llama 主干上达到了100%,实现了更高效、更有帮助的多轮对话,同时保留了单轮能力。 ## 1 引言 大语言模型(LLM)在给定完全指定的单轮提示时,能可靠地生成高质量响应(OpenAI, 2023 (https://arxiv.org/html/2605.24432#bib.bib5);Anthropic, 2023 (https://arxiv.org/html/2605.24432#bib.bib6);Grattafiori et al., 2024 (https://arxiv.org/html/2605.24432#bib.bib37);Yang et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib4))。然而,真实用户很少以这种方式交互。他们通常从一个欠指定的请求开始,并在后续轮次中提供更多细节来澄清需求,这是人类交流的常见特征(Zipf, 1949 (https://arxiv.org/html/2605.24432#bib.bib70);Ferreira, 2008 (https://arxiv.org/html/2605.24432#bib.bib110);Frisson, 2009 (https://arxiv.org/html/2605.24432#bib.bib109)),也是现实世界中LLM使用的主要模式(D'Amour et al., 2022 (https://arxiv.org/html/2605.24432#bib.bib71);Herlihy et al., 2024 (https://arxiv.org/html/2605.24432#bib.bib32))。然而,近期研究表明,LLM 在此设置下的表现奇差:在十五个领先的开源和闭源模型上,多轮欠指定对话相比携带相同信息的单轮提示,任务性能平均下降39%,这一现象被称为“对话迷失(Lost-in-Conversation)”(Laban et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib1))。弥合这一多轮差距颇具挑战,因为每类自然方法都会遇到不同障碍。推理时方法(如提示工程)往往难以改变模型固有能力(Huang et al., 2023 (https://arxiv.org/html/2605.24432#bib.bib157);Sharma et al., 2024 (https://arxiv.org/html/2605.24432#bib.bib223)),对提示设计敏感(Sclar et al., 2024 (https://arxiv.org/html/2605.24432#bib.bib77);Verma et al., 2024 (https://arxiv.org/html/2605.24432#bib.bib76)),且会引入影响实时部署的延迟(Mu et al., 2023b (https://arxiv.org/html/2605.24432#bib.bib78);Wu et al., 2025b (https://arxiv.org/html/2605.24432#bib.bib79))。后训练方法也有自身困难:仅使用监督微调(SFT)容易产生分布偏移和捷径学习,模型只是记忆表面模式而非习得可泛化的行为(Geirhos et al., 2020 (https://arxiv.org/html/2605.24432#bib.bib114);Chu et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib96);Lampinen et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib115))。在多轮设置下使用强化学习(RL)通常受困于稀疏奖励信号带来的长轨迹信用分配难题(Abdulhai et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib222);Lu and Lab, 2025 (https://arxiv.org/html/2605.24432#bib.bib9);Hübotter et al., 2026 (https://arxiv.org/html/2605.24432#bib.bib3)),以及随对话长度增长的前向采样成本(Wu et al., 2025a (https://arxiv.org/html/2605.24432#bib.bib2);Lu et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib80))。蒸馏能提供密集的、词元级别的学习信号,从而绕开RL的稀疏奖励问题,但通常需要更强的教师(Guo et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib35);Yang et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib4);Lu and Lab, 2025 (https://arxiv.org/html/2605.24432#bib.bib9)),然而即使是前沿模型在此设置中也表现不佳(Laban et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib1))。因此,弥合这一多轮差距需要一种新的训练框架。
参阅图注
图1:对话中发现(Found in Conversation)概览。SFT对模型进行预热启动:从标准单轮基准构建多轮语料,生成带多样性的每轮黄金答案,并使用标准因果语言模型损失进行训练。VASD在同一主干上运行两种信息等价的视图:教师视图(单轮设置)和学生视图(多轮设置,中间响应通过在线策略采样)。词元级别的蒸馏损失将学生分布与教师分布对齐。
本文提出**对话中发现(Found in Conversation,FiC)**,一个通用训练框架,使模型能在多轮对话中找到回归其原生单轮能力的方法(图1 (https://arxiv.org/html/2605.24432#S1.F1))。我们的动机观察是:同一模型在单轮中给定相同信息时表现更好。这表明差距是行为层面的而非能力层面的:能力存在于模型内部,但在多轮对话中难以浮现。FiC 通过两个互补阶段恢复这种潜在能力。首先,在精心构建的多轮语料上进行SFT,训练模型在信息缺失时推迟回应或请求澄清,并只有在所有必要细节给出后才给出答案。第二阶段,我们开发了一种新颖的**视图非对称自蒸馏(VASD)**方法,利用模型自身强大的单轮行为来教导其较弱的多轮行为。VASD 在同一主干上运行同一问题的两种视图:教师传递使用单轮视图,学生传递使用多轮视图。在最终答案位置应用词元级蒸馏损失(此时教师和学生都已拥有完整信息),将学生分布与教师分布对齐。VASD 是 FiC 的核心技术贡献。通过继承蒸馏的密集、词元级信号,VASD 规避了通常困扰多轮RL的稀疏奖励信用分配问题(Abdulhai et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib222);Lu and Lab, 2025 (https://arxiv.org/html/2605.24432#bib.bib9))。采用自蒸馏形式,VASD 绕过了标准蒸馏对更强外部教师的需求——而在此设置中这种教师是不存在的。VASD 利用了教师和学生之间一种新颖的非对称性。先前的自蒸馏方法通常使用*信息非对称性*作为学习信号:教师基于特权信息(如外部反馈(Hübotter et al., 2026 (https://arxiv.org/html/2605.24432#bib.bib3);Song et al., 2026 (https://arxiv.org/html/2605.24432#bib.bib220))或专家演示(Zhao et al., 2026 (https://arxiv.org/html/2605.24432#bib.bib208);Shenfeld et al., 2026 (https://arxiv.org/html/2605.24432#bib.bib218)))进行条件化,而学生看不到这些信息。然而,此特权信息在我们的设置中并不可用。VASD 则引入了一种新颖的*输入视图非对称性*:教师和学生共享相同的骨干和任务信息,仅在于信息呈现方式不同。这产生了干净的学习信号,因为教师-学生差距恰好是我们想要弥合的多轮vs单轮差距,没有任何其他分布差异。总之,VASD 通过密集的自蒸馏信号内部地弥合了多轮差距,无需更强的外部教师。
我们在 Laban et al. (2025 (https://arxiv.org/html/2605.24432#bib.bib1)) 的多轮基准上评估 FiC,涵盖不同模型家族(Llama (Grattafiori et al., 2024 (https://arxiv.org/html/2605.24432#bib.bib37))、Qwen (Team, 2024 (https://arxiv.org/html/2605.24432#bib.bib7))、Phi (Abdin et al., 2024 (https://arxiv.org/html/2605.24432#bib.bib34))和 OLMo (OLMo et al., 2024 (https://arxiv.org/html/2605.24432#bib.bib8)))及规模(3B–14B)。在多轮数学任务上,FiC 恢复了每个模型单轮性能的至少92%,包括在两个 Llama 骨干上实现了100%恢复,同时单轮能力基本保持不变。FiC 还实现了更高效的对话,最多可减少33%的令牌数。训练后的检查点可迁移到数据库和动作任务,仅需极少适配(不到6个A100-小时),并恢复了大部分差距。这些结果共同表明,利用我们的 FiC 框架,多轮差距在很大程度上可以从模型内部得以弥合。
## 2 问题形式化
多轮对话可以建模为序列 \(\{t_i\}_{i=1}^N\),共 \(N\) 轮,其中每轮 \(t_i := (u_i, m_i)\) 将用户输入 \(u_i\) 与模型响应 \(m_i \sim \pi(\cdot \mid t_{1:i-1} \cup \{u_i\})\) 配对。为了隔离并量化多轮递送本身引入的困难,我们考虑那些用户输入 \(\{u_i\}_{i=1}^N\) 存在一个*信息等价单轮对应体*的对话。具体来说,令 \(I(\cdot)\) 表示提示的任务相关信息,单轮提示 \(q\) 与多轮 \(\{u_i\}_{i=1}^N\) 信息等价当且仅当 \(I(q) = \bigcup_{i=1}^N I(u_i)\)。我们进一步聚焦于*欠指定*情境,即对于每个 \(i\),\(I(u_i) \subsetneq I(q)\)——没有单个用户轮次足以完成任务。在此设定下,模型在单轮 \(q\) 和多轮 \(\{u_i\}_{i=1}^N\) 上的表现可以直接比较:任何差距反映的是相同信息如何被递送,而非递送了何种信息。
令 \(\bar{P}(\pi; \cdot)\) 表示模型在输入集上的期望任务得分,Laban et al. (2025 (https://arxiv.org/html/2605.24432#bib.bib1)) 表明,对于信息等价对 \((q, \{u_i\}_{i=1}^N)\),\(\bar{P}(\pi; \{u_i\}_{i=1}^N) \ll \bar{P}(\pi; q)\) 在多种开源和前沿LLM中都成立(对话迷失)。这一设定不同于诸如思维链推理之类的回合制多轮范式,后者的任务从一开始就完全指定,多轮只是组合成最终答案的中间推理步骤。
给定模型 \(\pi\),我们的目标是找到训练框架 \(\mathcal{T}: \pi \mapsto \pi'\),能够弥合差距,使 \(\bar{P}(\pi'; \{u_i\}_{i=1}^N) \to \bar{P}(\pi; q)\),同时保持单轮性能:\(\bar{P}(\pi'; q) \approx \bar{P}(\pi; q)\)。我们定义指标*恢复率* \(R := \bar{P}(\pi'; \{u_i\}_{i=1}^N) / \bar{P}(\pi; q)\),并将训练过程限制为不使用更强外部模型的监督。这一限制是方法论上的,而非根本性的:它使单轮性能 \(\bar{P}(\pi; q)\) 成为原则上的上限(因此 \(R \leq 1\)),从而隔离出训练框架自身弥合了多轮差距的多少,与外部教师注入的任何能力无关。实践中,框架可以自由地纳入更强的模型作为监督来源,以进一步提升性能。
参阅图注
图2:同一指令的三种信息等价视图。**full**(左)呈现来自标准基准的原始单轮指令。**concat**(中)保留单轮结构,但将文字替换为碎片列表。**sharded**(右)在多轮对话中每轮揭示一个碎片——这是对话迷失发生的欠指定设置。
## 3 对话中发现(Found in Conversation)框架
**对话中发现(FiC)**是一个通用框架,模型在其中自学恢复其在多轮对话中的单轮能力。训练的第一阶段是在我们精心构建的多轮语料上进行监督微调(SFT),作为行为预热启动:它使模型学会在信息不完整时拒绝或请求澄清(第3.1节 (https://arxiv.org/html/2605.24432#S3.SS1))。第二阶段我们开发了新颖的**视图非对称自蒸馏(VASD)**,在同一骨干上运行同一问题的两种信息等价视图(第3.2节 (https://arxiv.org/html/2605.24432#S3.SS2))。VASD 通过蒸馏在词元级别将学生的多轮视图分布与教师的单轮视图分布对齐。两个阶段是互补的:SFT 使学生成为一个有能力的部分响应者,而 VASD 才是实际弥合多轮vs单轮差距的阶段。
### 3.1 SFT 用于根植上下文
对话迷失通常由过早的答案承诺驱动(Laban et al., 2025 (https://arxiv.org/html/2605.24432#bib.bib1)):模型用幻觉假设填补缺失条件,然后在后续轮次中锚定其上(图3左 (https://arxiv.org/html/2605.24432#S4.F3)),这种行为被标准后训练(优化即时下一轮奖励)所强化(Wu et al., 2025a (https://arxiv.org/html/2605.24432#bib.bib2))。除了产生无帮助的答案和浪费令牌外,这还破坏了模型带入对话剩余部分的上下文。因此,FiC 的第一阶段直接针对此行为:在精选的多轮语料上使用标准 SFT 训练模型,以推迟不完整的查询,在可预测时请求具体的缺失细节,并仅在提供足够信息后才给出答案。SFT 作为一个行为基础,产生带有根植上下文的对话,供 VASD 阶段操作。
#### 构建多轮语料。
我们遵循 Laban et al. (2025 (https://arxiv.org/html/2605.24432#bib.bib1)) 的流程,从标准单轮基准构建多轮语料。给定一个完全指定的单轮指令 \(q\),分片过程提示一个 LLM 将 \(q\) 分解为一组碎片 \(\{u_i\}_{i=1}^N\),这些碎片联合起来与 \(q\) 信息等价,且每个单独的碎片信息量严格更少(第2节 (https://arxiv.org/html/2605.24432#S2))。为了从经验上验证信息等价性,我们构造一个单轮提示 \(q_{\text{concat}} := \mathrm{concat}(u_1, \ldots, u_N)\),以要点列表形式列出所有碎片,并接受当模型在 \(q_{\text{concat}}\) 上的性能与在 \(q\) 上的性能匹配时的分片,两者均在单轮设置下。我们将同一底层问题的这三种呈现方式分别称为 **full** 视图(\(q\),原始单轮指令)、**concat** 视图(\(q_{\text{concat}}\),带拼接碎片的单轮)和 **sharded** 视图。相似文章
鲁棒批评者:防御LLMs免受多轮攻击
本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。
自蒸馏作为大语言模型的性能恢复机制:对抗压缩和灾难性遗忘
本文介绍了自蒸馏微调(SDFT)作为大语言模型性能恢复机制,用于解决灾难性遗忘、量化和剪枝导致的性能下降问题。作者利用中心核对齐(CKA)提供了理论证明,表明自蒸馏能够使学生模型的高维流形与教师模型的最优结构对齐,从而有效恢复丧失的能力。
多轮推理中信息分片段到达时的处理:可扩展分片与记忆增强强化学习
本文针对大语言模型在多轮对话中因信息分散而表现不佳的“迷失在对话”问题,提出了一种可扩展的分片流水线,将单轮问答数据集转化为多轮训练数据,并利用基于可验证奖励的强化学习训练一个维持紧凑滚动记忆的记忆增强策略,从而提高了多轮推理准确性,并零样本泛化到更困难的任务。
当注意力关闭:LLMs如何在多轮交互中迷失线索
本文从机制上解释了为什么LLMs在长时间的多轮交互中会丢失指令,引入了目标可访问性比率(GAR)指标和通道转换框架。通过消融研究和残差流探针,论文表明,对定义目标词元的注意力会在回合间关闭,而目标信息在残差表示中持续存在,并出现了架构特定的失败模式。
令牌统计揭示多轮大语言模型交互中的对话漂移
本文提出双可预测性(P)和信息数字孪生(IDT),一种使用令牌频率统计来监控多轮LLM交互中对话一致性的轻量级方法,无需使用嵌入或模型内部信息。该方法在检测矛盾和话题转换时达到100%的敏感度,同时为扩展LLM部署建立了实用的监控框架。