PAPA:在线个性化主动偏好对齐

arXiv cs.LG 论文

摘要

本文介绍了个性化主动偏好对齐(PAPA),一种无需参数化奖励模型、利用实时用户反馈微调扩散模型的方法,提高了推荐和图像生成等个性化任务的效率。

arXiv:2607.00486v1 公告类型:新 摘要:扩散模型在建模包括图像和文本在内的复杂数据分布方面非常有效。然而,在个性化推荐系统等应用中,目标往往转向建模分布中特定区域,以最大化用户偏好——这些偏好初始未知,但通过交互反馈逐步揭示。这自然可以视为一个强化学习问题,其目标是微调扩散模型以最大化基于偏好的奖励函数。然而,主要挑战在于学习一个参数化奖励模型,这通常需要大规模偏好数据——这在实践中往往不可行。在这项工作中,我们引入了个性化主动偏好对齐(PAPA),一种新颖的方法,通过直接利用实时用户反馈优化扩散模型,绕过了对参数化奖励模型的需求。PAPA 实现了高效反馈的偏好对齐,灵感来自变分推断框架。我们通过广泛的实验和消融研究,在多种类别条件化和细粒度对齐任务中证明了 PAPA 的有效性。此外,基于理论见解,我们提出了一种增强的微调策略,称为 EPAPA,它需要更少的计算预算并加速微调过程,进一步提升了 PAPA 在实际部署中的适用性。我们的代码已在 https://github.com/NasikNafi/papa 公开。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:38

# PAPA: 在线个性化主动偏好对齐  
来源: https://arxiv.org/html/2607.00486 \\usetikzlibrary decorations\.pathmorphing  

Nasik Muhammad Nafi  
橡树岭国家实验室  
nafinm@ornl\.gov  
共同第一作者。  

Isaac Lyngaas  
橡树岭国家实验室  
lyngaasir@ornl\.gov  

Muralikrishnan Gopalakrishnan Meena  
橡树岭国家实验室  
gopalakrishm@ornl\.gov  

Yevgeniy Vorobeychik  
华盛顿大学圣路易斯分校  
yvorobeychik@wustl\.edu  

###### 摘要  

扩散模型在建模复杂数据分布(包括图像和文本)方面非常有效。然而,在个性化推荐系统等应用中,目标常常转变为对分布中特定区域进行建模,以最大化用户偏好——这些偏好最初未知,但通过交互式反馈逐步揭示。这可以自然地建模为一个强化学习问题,其目标是微调扩散模型,以最大化基于偏好的奖励函数。然而,主要挑战在于学习一个参数化的奖励模型,这通常需要大规模的偏好数据——这在实践中往往不可行。在这项工作中,我们提出了**个性化主动偏好对齐(PAPA)**,这是一种新颖的方法,它无需参数化奖励模型,而是直接利用实时用户反馈优化扩散模型。PAPA 从变分推断框架中汲取灵感,实现了反馈高效的偏好对齐。我们通过跨多种类别条件和细粒度对齐任务的广泛实验和消融研究,展示了 PAPA 的有效性。此外,基于理论见解,我们提出了一种增强型微调策略,称为 **EPAPA**,它需要更少的计算预算,加速了微调过程,进一步提升了 PAPA 在实际部署中的适用性。我们的代码已公开发布在 https://github.com/NasikNafi/papa。  

††脚注:已被 ECML PKDD 2026 接收  

## 1 引言  

扩散模型是一种深度生成模型,通过逆转扩散过程生成数据,擅长捕捉自然图像流形等复杂空间。然而,在个性化产品推荐等应用中,目标是引导生成朝向与个体用户偏好相一致的物品,而这些偏好是通过用户活动随时间逐步揭示的。其他领域也存在类似的挑战。例如,在图像生成中,扩散模型是在从互联网抓取的海量数据集上训练的,但实际应用通常需要具有高美学质量的图像。事实上,许多其他场景也遵循这种一般结构,例如药物发现,其目标是引导生成朝向具有高生物活性的化合物。这可以建模为一个强化学习(RL)问题,其目标是微调扩散模型,以最大化反映用户理想属性的奖励。然而,这些方法依赖于大量的偏好数据来学习奖励模型,使得它们在个性化推荐平台等场景中效果不佳,因为在这些场景中,每个用户的大规模偏好数据不可用,但可以通过代价高昂的交互式反馈收集。  

参见图注  
图 1:所考虑的个性化主动偏好对齐问题概览。  

挑战是双重的:首先,实现这一目标需要高效的探索。然而,在高维空间(如自然图像空间)中,这不仅仅是发现新区域。还需要尊重问题的结构约束。例如,在产品推荐等领域,有效解决方案(如逼真的产品)通常被限制在一个低维流形内,该流形嵌入在更大的设计空间中。因此,一种有效的、反馈高效的微调方法必须在此空间内探索,同时保持在可行区域内,因为超出会导致浪费的无效查询。此外,基于迄今为止收集的偏好激进地优化来微调扩散模型可能会降低样本多样性。这是因为人类偏好往往是多模态的,如果模型过于关注一组狭窄的偏好,可能无法捕捉多样化用户偏好的全部谱系,从而导致生成的样本缺乏多样性。因此,高效的探索对于保持生成样本的质量和确保生成样本的更大多样性至关重要。  

其次,在许多应用中,一个关键挑战是获取真实奖励函数反馈的高昂成本。例如,在产品推荐系统中,确定用户偏好需要主观的人类判断,这既昂贵又耗时。这一挑战因模型不仅要探索新选项,还要利用已收集的信息生成与用户偏好一致的样本而进一步加剧。如果模型持续探索而不产生满足用户期望的样本,则可能使用户失去兴趣。简而言之,模型必须在探索和利用之间取得平衡——有效生成偏好对齐的样本,同时最小化昂贵的奖励查询。  

虽然最近有几项工作提出了基于 RL 的扩散模型微调方法 [2 (https://arxiv.org/html/2607.00486#bib.bib2), 8 (https://arxiv.org/html/2607.00486#bib.bib8), 27 (https://arxiv.org/html/2607.00486#bib.bib27)],但它们都没有直接解决在线环境中反馈效率的挑战。[28 (https://arxiv.org/html/2607.00486#bib.bib28)] 引入了一个考虑反馈在线性质的框架,但仍然依赖于一个独立的参数化奖励模型进行优化。我们的目标是开发一种反馈高效的在线微调方法,完全消除对单独奖励模型的需求,而是直接使用实时用户反馈微调扩散模型。尽管直接偏好优化 [16 (https://arxiv.org/html/2607.00486#bib.bib16)] 已经实现了高效的离线对齐,但这些方法在在线交互环境中经常失败,因为它们依赖于预先存在的大规模偏好数据。关键是,之前的方法,如 [22 (https://arxiv.org/html/2607.00486#bib.bib22)],未能将样本质量和多样性与对齐本身分离开来,导致当偏好跨越真实人类反馈中固有的多个异质类别时性能较差。  

为此,我们提出了一种基于变分推断工具推导的有原则的、反馈高效的扩散模型在线微调方法,旨在实现**个性化主动偏好对齐(PAPA)**。我们通过跨多个领域的全面实验和消融研究展示了 PAPA 的有效性。此外,我们提出了一种剪枝式微调策略,配合一种同时利用预训练模型和微调模型的采样方法。该策略显著降低了 PAPA 的训练计算需求,从而加速了微调过程。该方法的有效性得到了理论见解和实证结果的支持,突出了两个关键观察:(i) 预训练扩散模型在低噪声水平下保留强大的零样本去噪能力;(ii) 在低噪声水平下使用微调模型进行去噪可能会导致过拟合。下面,我们总结主要贡献:  

• 我们引入了 **PAPA**,一种新颖的扩散模型在线微调方法,可实现反馈高效的偏好对齐。  
• 我们还提出了 **EPAPA**(增强版 PAPA),一种剪枝式微调策略,可加速微调过程,同时降低计算成本,且不影响性能。  
• 我们通过跨不同偏好对齐设置的全面定量和定性消融研究,验证了 PAPA 和 EPAPA 每个组件的有效性。  
• 与先前方法相比,PAPA 能更快地适应和对齐细粒度对齐任务,使其非常适合实际交互式对齐场景。值得注意的是,PAPA 能够对齐跨不同类别的偏好,这是先前方法所缺乏的能力。  

## 2 相关工作  

使用 RL 微调扩散模型:使用人类反馈(例如用户偏好)微调生成模型已变得越来越流行 [20 (https://arxiv.org/html/2607.00486#bib.bib20), 26 (https://arxiv.org/html/2607.00486#bib.bib26)]。许多先前研究通过优化奖励函数来研究微调扩散模型,方法包括监督学习 [15 (https://arxiv.org/html/2607.00486#bib.bib15)]、基于控制的技术 [1 (https://arxiv.org/html/2607.00486#bib.bib1), 13 (https://arxiv.org/html/2607.00486#bib.bib13)] 或策略梯度 [2 (https://arxiv.org/html/2607.00486#bib.bib2)]。然而,这些方法通常依赖于静态奖励模型,将奖励视为固定的真实值,或者不允许在线反馈查询。相比之下,我们的方法专注于在线设置,实现交互式偏好学习,其中用户偏好最初未知,并通过顺序的用户反馈逐步揭示。[6 (https://arxiv.org/html/2607.00486#bib.bib6)] 提出了一种生成模型的通用在线学习方法。然而,他们的方法并非专门针对扩散模型,并且依赖于一个单独的奖励模型来选择高质量样本进行微调。这些关键差异从根本上将我们的工作区分开来。  

更近期,[28 (https://arxiv.org/html/2607.00486#bib.bib28)] 提出了一种扩散模型的反馈高效在线微调方法。然而,他们的方法仍然依赖于学习一个单独的奖励模型。[7 (https://arxiv.org/html/2607.00486#bib.bib7)] 引入的 SFT 方法将 RL 应用于扩散模型,以提高现有快速 DDPM 采样器的性能。ReFL [30 (https://arxiv.org/html/2607.00486#bib.bib30)] 利用 RLHF 框架。它首先基于人类偏好训练一个模型,然后通过强化学习微调扩散模型。DDPO [2 (https://arxiv.org/html/2607.00486#bib.bib2)] 将扩散模型的去噪过程表述为马尔可夫决策过程(MDP),以便使用多个奖励函数微调模型。所有这些模型都需要一个强大的奖励模型,这反过来需要大规模的图像数据集和全面的人类评估。  

直接偏好优化:在 RL 中,基于偏好而非显式奖励来探索策略已通过各种方法获得关注。基于偏好的强化学习 [16 (https://arxiv.org/html/2607.00486#bib.bib16)] 从隐藏评分函数导出的二元偏好中学习,而非显式奖励。最近提出了 DPO 方法 [22 (https://arxiv.org/html/2607.00486#bib.bib22)],直接使用偏好微调 LLM。它利用了奖励函数与最优策略之间的关系,在单阶段策略训练中有效解决了奖励最大化挑战。最近引入了 D³PO 方法 [31 (https://arxiv.org/html/2607.00486#bib.bib31)] 直接微调扩散模型。它的操作类似于 DPO,但成本更低,减少了扩散模型训练的计算开销。然而,这些方法并非针对在线设置设计;它们假设可以访问预先存在的大规模成对偏好数据来优化参数。  

## 3 预备知识  

去噪扩散模型(DMs)通过逐步对白高斯噪声进行去噪,从学习到的目标分布中生成样本。更正式地,扩散模型通过逆转一个具有 \(T\) 步的前向扩散过程来生成样本,该过程从数据点 \(x_{0}\) 开始,并按 \(x_{t}=\sqrt{\alpha_{t}}x_{t-1}+\sqrt{(1-\alpha_{t})}\tilde{\epsilon}_{t}\) 演化,\(t=1,\ldots,T\),其中 \(\{\tilde{\epsilon}_{t}\}\) 是独立同分布的标准高斯向量。此前向扩散过程的样本也可以表示为  

\[
x_{t}=\sqrt{\bar{\alpha}_{t}}x_{0}+\sqrt{(1-\bar{\alpha}_{t})}\epsilon_{t},\quad \epsilon_{t}\sim\mathcal{N}(0,I) \tag{1}
\]

其中 \(\bar{\alpha}_{t}=\prod_{s=1}^{t}\alpha_{s}\)。选择 \(\{\alpha_{t}\}\) 使得 \(\{\bar{\alpha}_{t}\}\) 形成一个单调序列,且 \(\bar{\alpha}_{T}\approx 0\)。这确保了密度 \(p_{x_{T}}\) 接近正态分布 \(\mathcal{N}(0,I)\)。通过将给定 \(x_{t}\) 时 \(x_{t-1}\) 的分布建模为高斯分布来学习反向扩散过程,其均值为  

\[
\mathbb{E}[x_{t-1}\mid x_{t}]=\frac{1}{\sqrt{\alpha_{t}}}\left(x_{t}-\frac{1-\alpha_{t}}{\sqrt{1-\bar{\alpha}_{t}}}\epsilon_{\theta}(x_{t},t)\right) \tag{2}
\]

协方差为 \(\sigma_{t}I\),其中 \(\epsilon_{\theta}(\cdot,\cdot)\) 是一个神经网络,\(\{\sigma_{t}\}\) 是固定的超参数。通过最小化 ELBO 损失进行训练,该损失简化为如下定义的一系列 MSE 项:

\[
L(\theta)=\sum_{t=1}^{T}\mathbb{E}_{x_{0},\epsilon_{t}}\left[\left\|\epsilon_{\theta}(x_{t},t)-\epsilon_{t}\right\|_{2}^{2}\right]. \tag{3}
\]

达到最优解时,神经网络近似后验均值,它依赖于时间步长:\(\epsilon_{\theta}(x_{t},t)=\mathbb{E}[\epsilon_{t}\mid x_{t}=x_{t}]\)。为了生成样本,扩散模型采样 \(x_{T}\sim\mathcal{N}(0,I)\),然后迭代地遵循学习到的反向概率来生成 \(x_{0}\) 的样本。具体来说,在每个时间步 \(t\),扩散模型将 \(x_{t}\) 作为输入,并预测噪声 \(\epsilon_{t}\),然后从中通过从反向分布采样得到 \(x_{t-1}\) [12 (https://arxiv.org/html/2607.00486#bib.bib12)]。  

## 4 问题形式化  

考虑一个预训练的扩散模型,例如 DDPM,记为 \(g_{\theta^{*}}\),初始参数为 \(\theta^{*}\in\Theta\subseteq\mathbb{R}^{d}\),其中 \(\Theta\) 表示完整的参数空间。该模型已在特定数据集 \(\mathcal{D}\) 上训练,该数据集包含从数据空间 \(X\) 上的分布 \(\mathcal{P}_{X}\) 中抽取的 \(m\) 个独立同分布 (i.i.d.) 样本 \(\{x_{i}\}_{i=1}^{m}\)。模型的目标是学习底层数据分布 \(\mathcal{P}_{X}\)。例如,当目标是生成自然图像时,\(|X|\) 的基数非常大。尽管原始设计空间巨大,但实际可行且有意义的解通常位于嵌入 \(X\) 中的一个复杂但可能低维的流形内,记为 \(\mathcal{X}_{feas}\)。  

我们考虑对 \(g_{\theta^{*}}\) 进行反馈高效的在线微调,以实现个性化主动偏好对齐。具体来说,我们在一个初始没有带有反馈的数据的设置中工作,但有一个在 \(\mathcal{P}_{X}\) 上训练的预训练扩散模型 \(g_{\theta^{*}}\)。我们的目标是微调 \(g_{\theta^{*}}\),以在时间步 \(t\) 上产生一系列新模型 \(g_{\theta^{ft}_{t}}\)... (注意:原文此处被截断,但翻译应保持原样)

相似文章

基于噪声追踪对的整流流离线偏好优化

Hugging Face Daily Papers

本文介绍了PNAPO,一种针对整流流模型的离线偏好优化框架,该框架通过噪声样本增强偏好数据,并采用动态正则化来提高训练效率和样本效率。

用于人类图像动画的隐式偏好对齐

Hugging Face Daily Papers

本文介绍了隐式偏好对齐(IPA),这是一种数据高效的训练后框架,可在无需成对偏好数据的情况下改善人类图像动画中的手部动作生成。它利用隐式奖励最大化和手部感知的局部优化来提高生成质量,同时降低数据整理成本。