人类策展何时及为何适得其反:多模型自消费循环下的偏好对齐

arXiv cs.AI 论文

摘要

本文研究了多模型体系中的自消费训练,表明由于跨模型交互,人类策展可能适得其反并损害长期对齐。

arXiv:2605.29267v1 Announce Type: new 摘要:基础模型越来越多地使用先前模型迭代生成的合成数据进行训练,而非仅依赖真实数据。这种自消费训练范式可能导致模型崩溃、发散或偏差放大。最近的研究(Ferbach et al., 2024)表明,将人类策展引入循环可以引导自消费模型向人类对齐行为发展,但这些分析仅针对单一、孤立的模型(即仅消费自身输出的模型)。然而在实践中,模型之间经常相互交互,并基于其他模型产生的输入-输出对进行训练。本文研究了多模型体系下的自消费训练。我们首先形式化了一个交互式自消费模型框架,并刻画了所得动力系统何时收敛到稳定点。接着,我们探讨了一个模型的人类策展如何影响其自身的对齐(自影响),以及这种效应如何传播到其他模型(交叉影响)。与孤立环境中人类策展总能增强模型对齐不同,我们发现跨模型交互会削弱甚至反转这种效应,最终损害长期对齐。
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:15

# 人类策展何时及为何适得其反:多模型自消耗循环下的偏好对齐

来源:https://arxiv.org/html/2605.29267

###### 摘要

基础模型越来越多地依赖于先前模型迭代生成的合成数据进行训练,而非仅使用真实数据。这种自消耗训练范式可能导致模型崩溃、发散或偏差放大。近期研究 (Ferbachet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib6)) 表明,将人类策展纳入循环可引导自消耗模型向人类对齐行为演进,但这些分析聚焦于单一孤立模型,即模型仅消耗自身输出。然而在实际场景中,模型之间常相互交互,并利用其他模型产生的输入输出对进行训练。本文研究多模型机制下的自消耗训练。我们首先形式化了交互式自消耗模型的框架,并刻画了该动力系统收敛至稳定点的条件。接着,我们探究一个模型的人类策展如何影响其自身对齐(自影响)以及这种效应如何传播至其他模型(交叉影响)。与孤立场景中人类策展总能增强模型对齐不同,我们发现跨模型交互会削弱甚至逆转这一效应,最终损害长期对齐。

机器学习, ICML

## 1 引言

现代基础模型已不仅仅是数据的消费者,它们已成为大规模的生产者——其输出在整个数据生态系统中流通,出现在网络上、进入标注流程、并融入下游微调数据集。因此,合成(通常经过策展的)数据在训练中常与真实数据混合使用。这形成了一个自消耗循环:模型不断用先前模型迭代生成的合成数据进行更新。例如,在语言领域,由一个LLM生成的合成指令数据被用于微调另一个模型,从而减少对昂贵人工标注的依赖 (Taoriet al.,2023 (https://arxiv.org/html/2605.29267#bib.bib27))。在视觉领域,扩散模型生成带标签的图像,这些图像被并入大规模数据集,用于训练或微调识别模型 (Shumailovet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib11))。在多模态场景中,自动描述模型生成伴随抓取图像的合成文本,而这些图像—文本对随后被大规模用于训练图像—文本模型 (Yuet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib28))。

受此启发,越来越多的研究致力于考察模型在自消耗训练循环下的演化 (Shumailovet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib11); Gao and Li,2025 (https://arxiv.org/html/2605.29267#bib.bib8); Bertrandet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib9); Caiet al.,2026 (https://arxiv.org/html/2605.29267#bib.bib2))。既有研究从理论和实验两方面表明,当模型生成内容被重复用于训练后续模型时,这类循环可能引发退化动力学并导致意外后果,包括模型崩溃 (Shumailovet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib11); Bertrandet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib9); Fuet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib13))、发散 (Shumailovet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib11)) 和偏差放大 (Wanget al.,2026 (https://arxiv.org/html/2605.29267#bib.bib18); Wyllieet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib20); Xie and Zhang,2024 (https://arxiv.org/html/2605.29267#bib.bib1))。

近期工作 (Ferbachet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib6); Zhaoet al.,2025 (https://arxiv.org/html/2605.29267#bib.bib15)) 进一步探索了人类策展在此过程中的作用,并显示:当合成数据在每次迭代中先由人类根据其偏好进行策展,再纳入训练集时,在自消耗循环下训练的模型会逐渐与人类偏好对齐,其输出能收敛到最大化人类期望奖励的分布。相反,当人类策展存在噪声或具有对抗性时,该对齐过程可能被破坏 (Wei and Zhang,2025 (https://arxiv.org/html/2605.29267#bib.bib10))。

然而,现有关于自消耗模型的工作主要局限于单一孤立模型(仅消耗自身输出),而现实世界的数据生态系统本质上是多模型的 (Pressmanet al.,2022 (https://arxiv.org/html/2605.29267#bib.bib23))。在网络规模语料库(如 LAION-5B (Schuhmannet al.,2022 (https://arxiv.org/html/2605.29267#bib.bib19)))中,模型生成的数据可被爬取并纳入未来的训练管线,从而通过循环数据将不同模型耦合起来 (Alemohammadet al.,2023 (https://arxiv.org/html/2605.29267#bib.bib12))。在此类系统中,更新一个模型会重塑用于训练其他模型的数据分布,而后者又可能反馈给前者,形成隐式交互网络。据我们所知,仅有少数研究考虑了多模型自消耗系统 (Huet al.,2025 (https://arxiv.org/html/2605.29267#bib.bib7); Gao and Li,2025 (https://arxiv.org/html/2605.29267#bib.bib8))。然而,这些工作要么是经验性的——强调多模型递归重用下的新崩溃模式 (Huet al.,2025 (https://arxiv.org/html/2605.29267#bib.bib7))——要么仅在高度简化的分布假设和更新规则下才可进行理论分析 (Gao and Li,2025 (https://arxiv.org/html/2605.29267#bib.bib8))。因此,我们仍缺乏一个统一的理论框架来回答若干实际相关的问题:多模型生态系统在迭代自消耗循环下如何演化?在什么条件下该系统收敛到稳定状态?应用于一个模型的人类策展如何长期影响其自身的对齐以及系统中其他模型的对齐?

在本文中,我们研究一个多模型设定:模型在由真实数据与自身及其他模型生成并策展的合成数据构成的混合数据上迭代更新。我们首先形式化一个分析框架,用于描述交互式自消耗模型,并刻画系统收敛到稳定点的条件。在收敛的前提下,我们进而分析人类策展对系统长期对齐的影响。具体而言,我们进行局部灵敏度分析,量化增加一个模型中人类策展合成数据的比例如何影响其自身对齐(自影响),以及这些效应如何传播至其他模型(交叉影响)。我们的结果凸显了与单模型场景的关键差异:在孤立自消耗循环中增加人类策展始终改善长期对齐 (Ferbachet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib6)),但在多模型机制下其效应变为非单调。跨模型交互可能放大、削弱甚至逆转人类策展的影响,我们的分析识别了人类策展可能长期负面损害对齐的条件。除这些局部效应外,我们还通过将混合真实—合成训练与纯真实数据训练进行比较,量化了全局对齐差距。

我们在附录A (https://arxiv.org/html/2605.29267#A1) 中讨论更多相关工作,并将主要贡献总结如下:

- • 我们形式化了一个交互式多模型自消耗系统框架,该框架可捕捉广泛的跨模型交互,并将人类偏好反馈纳入自消耗循环,且不依赖风格化的分布假设(第2节 (https://arxiv.org/html/2605.29267#S2))。
- • 我们提供了严格的分析,用于识别多模型系统收敛到稳定点的条件,并考察在跨模型交互下真实数据比例如何促进稳定性(第3节 (https://arxiv.org/html/2605.29267#S3))。
- • 我们量化了人类策展对模型对齐的长期影响。结果具有可解释性,并将效应分解为自影响(模型对策展的直接响应)和交叉影响(通过跨模型交互传播的影响)。这使我们能够识别人类策展改善或恶化长期对齐的条件(第4节 (https://arxiv.org/html/2605.29267#S4))。
- • 我们通过真实实验验证了理论发现,表明增加人类策展并不一定能改善模型对齐,且非单调行为与定理一致(第5节 (https://arxiv.org/html/2605.29267#S5))。

## 2 问题形式化

考虑一个多模型生态系统,其中每个模型在由真实数据以及自身或其他模型生成的合成数据构成的混合数据上迭代更新。为简单起见,我们聚焦于两个模型,在每轮tt时分别由参数θt∈Θ\\theta\_\{t\}\\in\\Theta和φt∈Φ\\phi\_\{t\}\\in\\Phi参数化,其中Θ,Φ\\Theta,\\Phi均为闭凸集。令x∈Xx\\in\\mathcal\{X\}和y∈Yy\\in\\mathcal\{Y\}分别表示模型θt\\theta\_\{t\}和φt\\phi\_\{t\}的输出。我们假设θt\\theta\_\{t\}的输入(对应输出)数据类型与φt\\phi\_\{t\}的输出(对应输入)数据类型匹配。在此假设下,相应的条件数据分布定义为

x∼pθt(x|y)且y∼qφt(y|x)x\\sim p\_\{\\theta\_\{t\}\}(x|y)~\\text\{ and \}~y\\sim q\_\{\\phi\_\{t\}\}(y|x)

该形式化可捕捉广泛的跨模型交互,包括同模态生成模型之间的交互(如文本模型,其输出被重用为其他文本模型的训练数据)、跨不同模态的交互(如图像到文本与文本到图像模型相互馈送)、以及生成模型与判别模型之间的交互(如预测类别标签的分类器与基于这些类别生成图像或文本的生成模型)。

图例说明:图1:(A1) 和 (A2) 展示了单个自消耗模型的框架以及每轮混合数据的生成方式。真实数据有助于稳定模型更新 (b) (Bertrandet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib9)),而人类策展有利于奖励提升 (a) (Ferbachet al.,2024 (https://arxiv.org/html/2605.29267#bib.bib6))。(B1) 展示了我们的多模型交互框架。不同模型可能按不同顺序更新。(B2) 详述了两个模型之间的一轮迭代。在模型交互下,系统内存在多个偏好 (e),一个模型可能使用其他模型生成/策展的数据进行进一步训练 (cd),从而影响自身的偏好对齐。目前尚不清楚多模型自消耗学习下交互如何影响每个模型 (f)。

训练数据来源。为保持强大性能并适应不断变化的环境,模型θt\\theta\_\{t\}和φt\\phi\_\{t\}反复使用最新获取的训练数据集Dt+1θ\\mathcal\{D\}^\{\\theta\}\_\{t+1\}和Dt+1φ\\mathcal\{D\}^\{\\phi\}\_\{t+1\}进行更新。这些数据集通常来自多个来源:

1. 1. 真实数据Rθ,Rφ\\mathcal\{R\}^\{\\theta\},\\mathcal\{R\}^\{\\phi\},其分布固定。
2. 2. 自消耗合成数据St+1θ,St+1φ\\mathcal\{S\}\_\{t+1\}^\{\\theta\},\\mathcal\{S\}\_\{t+1\}^\{\\phi\},包含由模型自身或其他模型生成的样本。令Pt+1x,yP\_\{t+1\}^\{x,y\}和Qt+1x,yQ\_\{t+1\}^\{x,y\}分别表示用于从θt\\theta\_\{t\},φt\\phi\_\{t\}获得更新模型θt+1\\theta\_\{t+1\},φt+1\\phi\_\{t+1\}的数据对(x,y)(x,y)的分布。模型在tt时生成的输出可能被纳入后续模型代次的训练数据。特别地,模型θt\\theta\_\{t\}可生成形式为 {(x′,y′):y′∼Pty,x′∼pθt(x|y′)},\\\{(x^\{\\prime\},y^\{\\prime\}):y^\{\\prime\}\\sim P\_\{t\}^\{y\},x^\{\\prime\}\\sim p\_\{\\theta\_\{t\}\}(x|y^\{\\prime\})\\\}, (1) 的合成样本,而模型φt\\phi\_\{t\}可生成样本 {(x′,y′):x′∼Qtx,y′∼qφt(y|x′)},\\\{(x^\{\\prime\},y^\{\\prime\}):x^\{\\prime\}\\sim Q\_\{t\}^\{x\},y^\{\\prime\}\\sim q\_\{\\phi\_\{t\}\}(y|x^\{\\prime\})\\\}, (2) 其中PtyP\_\{t\}^\{y\}和QtxQ\_\{t\}^\{x\}分别是Ptx,yP\_\{t\}^\{x,y\}和Qtx,yQ\_\{t\}^\{x,y\}的对应边际分布。为同时捕捉自模型和跨模型的影响,我们允许St+1θ,St+1φ\\mathcal\{S\}\_\{t+1\}^\{\\theta\},\\mathcal\{S\}\_\{t+1\}^\{\\phi\}包含由任一模型生成的样本,跨模型生成的比例分别为λθφ\\lambda\_\{\\theta\}^\{\\phi\}和λφθ\\lambda\_\{\\phi\}^\{\\theta\},自生成比例分别为1−λθφ1-\\lambda\_\{\\theta\}^\{\\phi\}和1−λφθ1-\\lambda\_\{\\phi\}^\{\\theta\}。

3. 3. 人类策展合成数据Ht+1θ,Ht+1φ\\mathcal\{H\}\_\{t+1\}^\{\\theta\},\\mathcal\{H\}\_\{t+1\}^\{\\phi\}。为使模型与人类偏好对齐,合成数据常通过人类反馈进行精炼,并由用户根据其偏好进行策展。该过程通常用广义Bradley-Terry模型 (Bradley and Terry,1952 (https://arxiv.org/html/2605.29267#bib.bib32); Luce and others,1959 (https://arxiv.org/html/2605.29267#bib.bib50)) 或直接偏好优化 (Rafailovet al.,2023 (https://arxiv.org/html/2605.29267#bib.bib33)) 建模。例如,给定由模型θt\\theta\_\{t\}(或φt\\phi\_\{t\})为给定输入i∼Ptyi\\sim P\_\{t\}^\{y\}(或QtxQ\_\{t\}^\{x\})生成的KK个样本O={o1,⋯,oK}\\mathcal\{O\}=\\\{o\_\{1\},\\cdots,o\_\{K\}\\\}, ok∼pθt(x|i)o\_\{k\}\\sim p\_\{\\theta\_\{t\}\}(x|i)(或pφt(y|i)p\_\{\\phi\_\{t\}\}(y|i)),在广义Bradley-Terry模型下,用户选择样本o^∈O\\hat\{o\}\\in\\mathcal\{O\}的概率为:

P(o^=os|i,O)=er(i,os)∑k=1Ker(i,ok)\\displaystyle\\mathbb\{P\}(\\hat\{o\}=o\_\{s\}|i,\\mathcal\{O\})=\\frac\{e^\{r(i,o\_\{s\})\}\}\{\\sum\_\{k=1\}^\{K\}e^\{r(i,o\_\{k\})\}\} (3)

其中rr是捕捉用户偏好的底层奖励函数。策展数据集Ht+1θ,Ht+1φ\\mathcal\{H\}\_\{t+1\}^\{\\theta\},\\mathcal\{H\}\_\{t+1\}^\{\\phi\}也包含从任一模型策展的样本,我们假设它们的跨模型数据比例与St+1θ,St+1φ\\mathcal\{S\}\_\{t+1\}^\{\\theta\},\\mathcal\{S\}\_\{t+1\}^\{\\phi\}一致。

对于每个模型j∈{θ,φ}j\\in\\\{\\theta,\\phi\\\},训练数据Dt+1j\\mathcal\{D\}^\{j\}\_\{t+1\}背后的分布是Rt+1j,St+1j,Ht+1j\\mathcal\{R\}\_\{t+1\}^\{j\},\\mathcal\{S\}\_\{t+1\}^\{j\},\\mathcal\{H\}\_\{t+1\}^\{j\}的混合。相应的混合权重分别记为λRj,λSj,λHj\\lambda\_\{\\mathcal\{R\}\}^\{j\},\\lambda\_\{\\mathcal\{S\}\}^\{j\},\\lambda\_\{\\mathcal\{H\}\}^\{j\},且满足λRj+λSj+λHj=1\\lambda\_\{\\mathcal\{R\}\}^\{j\}+\\lambda\_\{\\mathcal\{S\}\}^\{j\}+\\lambda\_\{\\mathcal\{H\}\}^\{j\}=1。

迭代训练循环。由于自消耗和人类策展合成数据都依赖于θ,φ\\theta,\\phi,我们将生成的训练数据分布记为Pt+1x,y:=P(θ,φ)P\_\{t+1\}^\{x,y\}:=P(\\theta,\\phi)和Qt+1x,y:=Q(θ,φ)Q\_\{t+1\}^\{x,y\}:=Q(\\theta,\\phi),分别对应于Dt+1θ\\mathcal\{D\}^\{\\theta\}\_\{t+1\}和Dt+1φ\\mathcal\{D\}^\{\\phi\}\_\{t+1\},以明确强调这种依赖性。根据模型更新是同步还是异步进行……

相似文章

对齐篡改:人类反馈强化学习如何被利用来优化失调偏见

Hugging Face Daily Papers

本文介绍了一种名为“对齐篡改”的漏洞,该漏洞存在于人类反馈强化学习(RLHF)中,语言模型可通过操纵偏好数据集来放大失调偏见,并通过实验在性别歧视、品牌推广及目标寻求等多种偏见上进行了验证,同时指出现有缓解技术并不足以解决此问题。

建构性对齐:调控人机交互中的偏好动态

arXiv cs.AI

本文介绍了建构性对齐,这是一种重新定义AI对齐的范式,将其视为调控人类偏好随时间的演变,而非满足静态偏好。它提出了一个控制理论框架,用于规范AI系统如何影响价值轨迹。

默认极化:LLM 内容策展中的推荐偏差审计

arXiv cs.CL

本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。

CurateEvo:面向智能体后训练的数据策展进化

arXiv cs.CL

CurateEvo 是一个以失败为驱动的动态进化框架,用于智能体后训练的数据策展。它利用失败轨迹迭代重写策展策略,在 ACEBench-Agent 和 BFCL-V4 等基准上提升了效果和效率。