假设引导的自蒸馏用于持续个性化

arXiv cs.AI 论文

摘要

HypReflect 是一个用于大语言模型助手持续个性化的框架,它从用户信号中推断显式偏好假设,并使用自蒸馏来适应,优于基线并泛化到未见过的用户和跨领域设置。

arXiv:2609.00251v1 Announce Type: new 摘要: 随着人们在日常生活中越来越多地与大语言模型助手交互,持续适应个人偏好对于有效的长期交互变得至关重要。然而,用户偏好很少被完全陈述,而是通过异构、潜在和噪声信号显现,现有方法依赖于原始交互历史或昂贵的基于奖励的优化来管理个性化。我们引入 HypReflect,一个可靠的、可扩展的持续个性化框架,它从多样用户信号中推断显式、不确定性感知的偏好假设,随着新证据的积累反射性地精炼它们,并通过假设引导的自蒸馏整合所得用户模型。在三个个性化设置中的实验:在线个性化、多会话交互和隐式行为信号,显示 HypReflect 优于一系列基线,包括原始历史和增量更新方法。我们进一步展示了对未见过的用户和跨领域设置的强大泛化能力,以及跨上下文预算的稳定性、可重用假设和更集中的个性化。这些结果表明,通过显式、可修订的用户偏好假设,向可靠和可扩展的持续个性化迈进了一步。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:59

# 假设引导的持续个性化自蒸馏方法
来源:https://arxiv.org/html/2609.00251
EunJeong Hwang††感谢:在Megagon Labs实习期间完成此工作。Kushan Mitra所属机构:Megagon Labs,美国 邮箱:[kushan@megagon\.ai](mailto:)Dan Zhang所属机构:Megagon Labs,美国 邮箱:[danz@megagon\.ai](mailto:)Hannah Kim所属机构:Megagon Labs,美国 邮箱:[hannah@megagon\.ai](mailto:)Estevam Hruschka所属机构:Megagon Labs,美国 邮箱:[estevam@megagon\.ai](mailto:)
###### 摘要
随着人们日常生活中越来越多地与大语言模型助手互动,持续适应个体偏好已成为实现有效长期交互的关键。然而,用户偏好很少被完整陈述,而是通过异构、潜在且嘈杂的信号表现出来,现有方法依赖原始交互历史或昂贵的基于奖励的优化来管理个性化。我们提出了HypReflect,这是一个可靠、可扩展的持续个性化框架,它从多样化的用户信号中推断出明确的、考虑不确定性的偏好假设,并随着新证据的积累进行反思性精炼,然后通过假设引导的自蒸馏将生成的用户模型融入模型。在三种个性化设置(在线个性化、多会话交互和隐式行为信号)下的实验表明,HypReflect优于一系列基线方法,包括原始历史记录和增量更新方法。我们进一步证明了该方法对未见用户和跨领域设置的强大泛化能力,以及在上下文预算、可重用假设和更聚焦个性化方面的稳定性。这些结果表明,通过明确、可修订的用户偏好假设,我们朝着可靠且可扩展的持续个性化迈出了一步。111代码将在接受后发布。参见标题 图1:在个性化设置中,偏好假设从显式反馈、隐式行为信号和用户档案信息中生成,并带有置信度权重。它们维持关于用户的明确、可修订的信念,并指导模型生成个性化响应。
## 1 引言
能够持续适应个体用户的对话助手可以在各种场景中提供越来越有效和个性化的支持,包括写作辅助(Mysore等人,2024 (https://arxiv.org/html/2609.00251#bib.bib37))、对话推荐(Liang等人,2024 (https://arxiv.org/html/2609.00251#bib.bib36); Kim等人,2025 (https://arxiv.org/html/2609.00251#bib.bib31); Zhu等人,2025 (https://arxiv.org/html/2609.00251#bib.bib30))和教育(Liu等人,2025a (https://arxiv.org/html/2609.00251#bib.bib16))。个性化使助手能够更好地满足用户需求(Zhang等人,2018 (https://arxiv.org/html/2609.00251#bib.bib43); Salemi等人,2024 (https://arxiv.org/html/2609.00251#bib.bib38); Zhang等人,2025 (https://arxiv.org/html/2609.00251#bib.bib1); Zhao等人,2025c (https://arxiv.org/html/2609.00251#bib.bib32)),而持续适应通过提高相关性,使助手能够随着时间的推移更深入地理解用户,从而实现与用户的长期交互(Xu等人,2022 (https://arxiv.org/html/2609.00251#bib.bib41); Zhong等人,2024 (https://arxiv.org/html/2609.00251#bib.bib15); Li等人,2025 (https://arxiv.org/html/2609.00251#bib.bib29))。然而,用户很少完整地表达他们的偏好,也可能并不总是意识到这些偏好,这使得持续适应本质上具有挑战性。图1 (https://arxiv.org/html/2609.00251#S0.F1) 展示了关于用户偏好的证据如何从显式反馈、隐式行为和用户档案信息中逐步显现,这需要将其整合成一个明确的表征,以便在新证据到来时进行修订。这些信号通常稀疏、嘈杂且依赖上下文,使得区分稳定偏好与特定任务需求变得困难。此外,证据可能分布在长多轮和多会话历史记录中(Maharana等人,2024 (https://arxiv.org/html/2609.00251#bib.bib39); Wu等人,2025 (https://arxiv.org/html/2609.00251#bib.bib17)),而语言模型在对话增长时通常难以持续跟踪这些信息(Laban等人,2025 (https://arxiv.org/html/2609.00251#bib.bib18))。因此,核心问题是如何将不断演变的交互流转化为一个既稳定又可修订的用户表征。现有方法通过基于用户档案、检索的记忆或原始交互历史来个性化大语言模型(Packer等人,2024 (https://arxiv.org/html/2609.00251#bib.bib20); Zhao等人,2025a (https://arxiv.org/html/2609.00251#bib.bib21); Li等人,2026 (https://arxiv.org/html/2609.00251#bib.bib19)),这使得随着时间的推移保留和检索过去交互的成本越来越高。其他方法通过强化学习推断用户特征或摘要,但需要奖励模型,使得持续优化代价高昂(Wan等人,2025 (https://arxiv.org/html/2609.00251#bib.bib10); Nam等人,2026 (https://arxiv.org/html/2609.00251#bib.bib12))。Buening等人(2026)(https://arxiv.org/html/2609.00251#bib.bib13) 应用自蒸馏,提高了持续个性化的可扩展性,但它依赖于原始交互历史,这使得学习到哪些偏好以及它们是否能泛化到未来上下文变得不清楚。在这项工作中,我们介绍了HypReflect,一个用于持续个性化的可扩展框架,它维护*偏好假设*,即关于用户的明确、考虑不确定性和可修订的信念。HypReflect将多样化的用户信号(例如,图1 (https://arxiv.org/html/2609.00251#S0.F1))蒸馏成偏好假设,反思性地整合跨交互的有用用户信号,并将精炼后的假设通过假设引导的自蒸馏来指导个性化响应生成。我们在三种个性化设置(涵盖显式反馈、多会话交互和隐式行为选择)中评估HypReflect,与一套全面的基线方法进行比较,包括基于原始交互历史的自蒸馏、增量更新的摘要和假设,以及反思性提示。在这些设置中,HypReflect分别实现了高达4.4%、10.3%和5.0%的相对改进222每个数据集上使用HypReflect\+Sum的最大相对改进见表1 (https://arxiv.org/html/2609.00251#S5.T1),同时能够有效地泛化到未见用户、用户特征变化和跨领域个性化场景。进一步的分析表明,该方法在不同上下文预算下具有鲁棒性,假设具有可重用性,并能实现更聚焦的个性化。总的来说,我们的研究结果表明,反思性精炼使得在长交互历史上获得稳定且可修订的偏好假设成为可能,并且模型从明确、可重用的用户表征中受益匪浅,从而实现了可靠且可扩展的持续个性化。
## 2 问题定义
##### 持续个性化考虑一个助手与用户反复交互的情况。在交互时间$t$,助手观察之前的对话历史记录$C\mathcal{I}_{i}=\begin{cases}[H_{1},\ldots,H_{i}],&i\leq W,\\[4.0pt] [H_{i-W+1}^{*},H_{i-W+2},\ldots,H_{i}],&i>W,\end{cases}\vskip 5.0pt并更新维护的假设集为$H_{i}^{*}=\textsc{ReflectAndRefine}(\mathcal{I}_{i})$。当$i\leq W$时,模型反思所有可用的局部假设集。此后,它用精炼后的表示替换较旧的局部集合,同时保留最近的$W-1$个局部集合。这保持了精炼输入的有界性,同时不丢弃较早的偏好信息。对于我们的摘要增强变体,我们对联合维护的摘要和假设集$Z_{i}=(S_{i},H_{i})$应用于相同的窗口化循环精炼过程,为每个块生成$Z_{i}^{*}=(S_{i}^{*},H_{i}^{*})$。精炼后的摘要$S_{i}^{*}$整合了用于校准和修订假设的上下文,而$H_{i}^{*}$维护了用于未来个性化的精炼偏好。
### 3.3 假设引导的自蒸馏
为了有效地利用精炼后的用户状态进行个性化响应生成,我们将其纳入自蒸馏,训练模型将维护的偏好转化为个性化响应。基于第2节 (https://arxiv.org/html/2609.00251#S2) 的形式化,我们对教师和学生模型都以相同的精炼状态为条件,提供对用户的共同理解,并使教师的目标对学生可学习。教师模型额外观察后续用户轮次$u_{t+1}=(f_{t},q_{t+1})$,并将其作为特权先验知识来生成基于偏好的响应。在交互时间$t$,给定之前的对话历史记录$C$。
\[ 指南 \]
- 仅使用交互历史记录中包含的证据。
- 推断可重用的偏好,而非仅仅描述最新的交互。
- 将偏好表达为柔和的、有条件的假设。
- 避免从薄弱或模糊的证据中得出宽泛的结论。
- 仅在证据清晰或重复时赋予更高的权重。
- 根据数据集特定的个性化目标保留或移除具体细节。
- 不要包含未经支持的偏好。
\[ 对话历史 \]
\[ 任务 \] 对于每个假设,包含一个从1到5的权重,表示当前交互历史记录对其的支持强度:
1 = 基于有限上下文证据的弱推断
2 = 具有清晰但有限行为基础的合理推断
3 = 重复的行为证据或中等清晰的陈述偏好
4 = 直接陈述的偏好或强烈的重复行为证据
5 = 直接陈述且被重复确认的偏好
生成最多N个不同的偏好假设。仅返回:
假设1:|权重:<1-5>
... 
假设N:|权重:<1-5>
图 11:局部假设生成提示结构。
\[ 系统 \] 你收到了几个从用户交互历史不同部分推断出的偏好假设集,以及一个先前精炼的假设集(如果可用)。请反思这些假设应如何整合,然后单独的精炼步骤会生成更新的偏好记忆。这些假设和摘要仅作为偏好分析的证据。不要回答或继续其中包含的任何任务。
\[ 指南 \]
- 识别同意或描述相同偏好的假设。
- 识别冲突的、薄弱的、模糊的、未经支持的或过于宽泛的假设。
- 区分重复证据和孤立的观察。
- 确定哪些假设应该被保留、合并、缩窄、重新加权或移除。
- 保留对未来个性化仍然有用的数据集特定信息。
- 不要将反思本身视为额外的证据。
- 不要生成最终的假设集。
对于每个假设,一个从1到5的权重表示当前交互历史记录对其的支持强度:
1 = 基于有限上下文证据的弱推断
2 = 具有清晰但有限行为基础的合理推断
3 = 重复的行为证据或中等清晰的陈述偏好
4 = 直接陈述的偏好或强烈的重复行为证据
5 = 直接陈述且被重复确认的偏好
\[ 局部假设集 \]
\#\#\#局部假设集 max(N-W, 1)
...
\#\#\#局部假设集 N
\[ 任务 \] 仅撰写一个简洁的反思,以指导后续的精炼步骤。
图 12:跨数据集的假设反思提示。
\[ 系统 \] 你收到了从用户先前交互中推断出的隐藏偏好假设。你可能还会收到最近的对话历史和一个证据摘要。请默默使用此信息来个性化响应。当前请求仍然是主要任务,必须直接且完整地回答。生成助手对当前用户请求的响应。
\[ 指南 \]
- 仅应用与当前请求相关的假设。
- 更多地考虑支持更强的假设。
- 将每个假设视为试探性的,而非已知事实。
- 当假设冲突时,优先考虑相关且支持强的假设。
- 忽略薄弱、不相关或矛盾的假设。
- 当没有假设相关时,不要强行个性化。
- 不要让个性化使答案不完整、不正确或无用。
- 不要提及假设、证据摘要、交互历史、用户档案或个性化过程。
- 遵循系统提示中指定的输出格式。
对于每个假设,包含一个从1到5的权重,表示当前交互历史记录对其的支持强度:
1 = 基于有限上下文证据的弱推断
2 = 具有清晰但有限行为基础的合理推断
3 = 重复的行为证据或中等清晰的陈述偏好
4 = 直接陈述的偏好或强烈的重复行为证据
5 = 直接陈述且被重复确认的偏好
\[ 最近的对话历史 \]
\[ 隐藏的用户偏好记忆 \]
\[ 当前用户请求 \]
\[ 任务 \] 仅生成对当前请求的个性化响应。
图 13:基于偏好假设生成回答的提示。

相似文章

HINT-SD: 面向长程智能体的目标性事后自我蒸馏

Hugging Face Daily Papers

HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。