异质偏好学习
摘要
本文提出了一种从多模态数据中学习个体化效用函数的多阶段架构,表明在美学判断等主观任务中,考虑异质偏好的模型优于通用效用模型。
arXiv:2609.17847v1 Announce Type: new
摘要:从人类反馈中学习已成为训练现代AI系统的核心范式,其中人类效用模型被用作策略学习中的奖励模型。现有方法通常假设一个跨人群共享的\emph{通用效用}函数,并将标注者之间的分歧视为随机变化。虽然这对于客观任务是合适的,但在主观领域,偏好因个体而异,此假设便不再成立。我们研究了主观偏好学习问题,其中观察到的选择源于异质但内部一致的效用函数。借鉴理性选择理论(RCT)\parencite{tversky1981framing},我们引入了\emph{个体化效用}函数,该函数同时以个体和决策上下文为条件,并提出了一种新颖的多阶段架构来从多模态数据中估计这些函数。我们在一个新收集的数据集上评估了我们的框架,该数据集包含来自2,398名参与者的超过575,000次成对美学判断,比较汽车轮毂设计。我们的实验表明,个体化效用模型显著优于包括基础模型基线在内的通用效用模型。我们的结果表明,分歧反映了有意义的偏好异质性,而非标注噪声。更广泛地说,我们的发现强调了收集标注者属性和学习个体化效用函数的重要性,从而能够构建明确考虑其代表的偏好的奖励模型,并忠实捕捉人类决策的多样性。
查看缓存全文
缓存时间: 2026/09/17 09:25
# 学习异质性偏好
来源:https://arxiv.org/html/2609.17847
Matt HongDule ShuAniek FransenShabnam HakimiMatt Klenk机构:以人为中心的AI机构:丰田研究院机构:加利福尼亚州洛斯阿尔托斯邮箱:[shiwali\.mohan@gmail\.com](mailto:)
###### 摘要
基于人类反馈的学习已成为训练现代AI系统的核心范式,其中人类效用模型被用作策略学习中的奖励模型。现有方法通常假设存在一个跨人群共享的*通用效用*函数,并将标注者之间的分歧视为随机波动。虽然这种方法适用于客观任务,但在偏好因个体而异系统性变化的主观领域,这种假设就不适用了。我们研究主观偏好学习问题,其中观察到的选择源于异质但内在一致的效用函数。借鉴理性选择理论(RCT)\[29 (https://arxiv.org/html/2609.17847#bib.bib6)\],我们引入了基于个体及其决策情境的*个体化效用*函数,并提出了一种新颖的多阶段架构,用于从多模态数据中估计这些函数。我们使用一个新收集的数据集来评估我们的框架,该数据集包含来自2,398名参与者的超过575,000对关于汽车轮毂设计的成对美学判断。我们的实验表明,个体化效用模型显著优于通用效用模型,包括基础模型基线。我们的结果表明,分歧反映了有意义的偏好异质性,而非标注噪声。更广泛地说,我们的研究结果强调了收集标注者属性和学习个体化效用函数的重要性,这使得奖励模型能够明确考虑其代表谁的偏好,并忠实地捕捉人类决策的多样性。
## 1引言
从人类的选择、比较和判断中学习已成为现代机器学习(ML)系统的基础范式\[7 (https://arxiv.org/html/2609.17847#bib.bib28),22 (https://arxiv.org/html/2609.17847#bib.bib30),20 (https://arxiv.org/html/2609.17847#bib.bib29)\]。当代算法不依赖于真实标签,而是从比较反馈中学习:标注者被呈现两个或更多候选选项(例如,图像说明、回复或计划),并被要求说明他们更喜欢哪一个。所得到的选择通过潜在效用估计的视角来解释,其中每个候选选项被假定具有一个未被观察到的值,而观察到的选择提供了关于它的有噪声的证据。从成对比较中恢复效用函数是现代基于人类反馈的强化学习(RLHF)的基础,其中学习到的效用用作奖励函数\[4 (https://arxiv.org/html/2609.17847#bib.bib27)\]。
传统偏好学习建立在*通用效用*函数在所有决策者之间共享的假设之上。在这种观点下,每个标注者使用相同的潜在效用来评估选项,分歧被认为是由于标注噪声或测量误差造成的。这种假设非常适合具有客观正确答案的任务,例如数学推理或事实问答。
然而,许多现实世界的决策本质上是主观的。对美学的判断、写作质量的评估、政策的评估等,没有单一的普遍偏好的答案。相反,个体表现出虽然多变但稳定且一致的偏好,这些偏好源于个性、过往经历、文化和个人品味的差异。在这些情境中,分歧不仅仅是在通用效用函数周围的噪声;相反,它反映了底层效用函数本身的系统性差异。在这种情况下,学习一个带有噪声的通用效用函数会掩盖人类偏好中有意义的异质性。
在本文中,我们引入了*主观偏好学习*问题,它用*个体化效用*取代了通用效用。我们不是学习一个跨人群共享的单一效用函数,而是寻求学习一个基于决策者条件的效用函数。我们的形式化基于理性选择理论(RCT)\[29 (https://arxiv.org/html/2609.17847#bib.bib6)\],该理论将决策建模为决策者特征和决策情境相互作用的结果。这种观点自然地引出了跨个体系统性变化的效用函数,而不是将个体间差异视为标注噪声。
在本文中,我们研究汽车轮毂设计的美学判断,在这个领域中,视觉设计语言、过往经历和个人品味自然地产生了多样但一致的偏好。我们的贡献是:
1. 1\.我们提出了*主观偏好学习*,这是偏好学习的一个扩展,它用*个体化效用*取代了通用效用。
2. 2\.我们提出了一种神经架构,用于从成对比较判断中学习个体化效用函数。
3. 3\.我们在一个大规模的美学判断数据集上证明,个体化效用模型显著优于通用效用模型,包括基于提示的大语言模型基线。
我们的工作通过将通用效用替换为个体化效用,为日益增长的多元对齐文献做出了贡献。这一观点为基于人类反馈的强化学习(RLHF)中的个性化奖励模型提供了自然的基础,使得AI系统能够更好地反映人类价值观、观点和决策的多样性。
## 2相关工作
我们的工作建立在从包含噪声比较的数据集中学习人类偏好的长期研究基础之上。
#### 排序
一系列工作将偏好建模形式化为排序问题,借鉴了学习排序(LTR)文献\[14 (https://arxiv.org/html/2609.17847#bib.bib18)\]。LTR方法通常根据训练信号分为三类:点对点法\[16 (https://arxiv.org/html/2609.17847#bib.bib19)\],通过回归或分类独立地对单个项目进行评分;成对法\[2 (https://arxiv.org/html/2609.17847#bib.bib20),30 (https://arxiv.org/html/2609.17847#bib.bib21)\],从项目对之间的相对比较中学习——RankNet是一个代表性例子,它使用交叉熵损失训练一个神经评分器,损失基于一个项目优于另一个项目的概率;以及列表法\[3 (https://arxiv.org/html/2609.17847#bib.bib22),31 (https://arxiv.org/html/2609.17847#bib.bib23),21 (https://arxiv.org/html/2609.17847#bib.bib24)\],它一次优化整个排序列表。我们的方法与成对LTR最相关,特别是来自推荐系统社区的个性化变体,如BPR\[24 (https://arxiv.org/html/2609.17847#bib.bib25)\]和VarBPR\[18 (https://arxiv.org/html/2609.17847#bib.bib26)\]。与BPR和VarBPR不同,我们的方法使用神经网络来建模多模态数据,并使用标准的交叉熵直接从个体成对比较中学习,避免了基于包的采样和变分推断。
#### 个性化奖励建模
RLHF\[12 (https://arxiv.org/html/2609.17847#bib.bib14)\]通常包括两个阶段:从成对人类偏好中学习奖励(效用)模型,以及使用诸如近端策略优化\[26 (https://arxiv.org/html/2609.17847#bib.bib16),4 (https://arxiv.org/html/2609.17847#bib.bib27)\]之类的方法根据该奖励优化策略。直接策略优化(DPO)\[23 (https://arxiv.org/html/2609.17847#bib.bib8)\]方法直接从人类数据中学习策略。我们的工作专注于PPO的第一阶段,并探索在主观领域中效用函数应如何表示。
我们的工作为*多元对齐*\[28 (https://arxiv.org/html/2609.17847#bib.bib7)\]做出了贡献,该领域主张大型模型应反映多样的人类观点,而非单一的共识偏好。这一观点促使收集记录标注者属性和偏好标签的数据集\[13 (https://arxiv.org/html/2609.17847#bib.bib34)\],以及个性化奖励的方法,包括学习个体特定的奖励模型\[5 (https://arxiv.org/html/2609.17847#bib.bib31)\]、基础奖励模型的混合\[27 (https://arxiv.org/html/2609.17847#bib.bib33)\]、从历史交互中检索相似用户\[34 (https://arxiv.org/html/2609.17847#bib.bib32)\],以及个性化直接偏好优化(P-DPO)\[17 (https://arxiv.org/html/2609.17847#bib.bib17)\]。
先前的工作侧重于语言模型的端到端个性化,而我们则研究奖励(效用)模型本身的构建。基于行为经济学中的RCT,我们研究异质性判断如何源于*个体化效用函数*,而非通用效用,并探讨其在异质性是决策内在属性的领域中的意义。与通常以语言为中心的先前工作不同,我们在参与者通过判断视觉美学来做出决策的多模态环境中验证我们的框架。最后,与通常使用第二个LLM来评估个性化的先前工作不同,我们使用真实的人类数据进行评估。
#### 使用LLM进行模拟
越来越多的工作使用大语言模型(LLM)作为人类决策者的模拟器,通过将提示条件化于角色描述或人口统计属性,来预测特定个体将如何判断主观任务(例如,\[32 (https://arxiv.org/html/2609.17847#bib.bib5)\])。我们的实验表明,对于美学判断,仅靠角色提示相比于基于人群的预测几乎没有改进,这凸显了明确学习个体化效用函数的必要性。
美学评判已成为评估多模态大语言模型(MLLM)能否替代人类评估者的重要试验场。诸如AesBench\[9 (https://arxiv.org/html/2609.17847#bib.bib2)\]和\[6 (https://arxiv.org/html/2609.17847#bib.bib4)\]的成对评估框架等基准测试表明,尽管现代MLLM能捕捉到美学推理的许多方面,但它们的性能仍明显低于人类。最近的工作转向了个性化美学建模。AesBiasBench\[15 (https://arxiv.org/html/2609.17847#bib.bib3)\]研究了基于MLLM的美学评估中的人口统计偏差和个性化,而PRAC\[33 (https://arxiv.org/html/2609.17847#bib.bib1)\]则通过微调用户特定的适配器来转移相似用户间的知识,从而实现MLLM的个性化。这些工作证实了美学判断存在系统性的异质性,并推动了个性化的需求。我们的工作通过将美学评判形式化为学习*个体化效用*,为建模这种异质性发展了一个有理论基础的框架。
## 3问题形式化
考虑一个消费者判断两辆汽车中哪一辆更*运动*。尽管观察到的判断是在两个选项之间的二元选择,但底层的决策过程不仅取决于汽车的视觉属性,还取决于做出决策的个体。两个消费者可能持续地不同意哪辆汽车更运动,因为他们对什么是让汽车看起来*运动*的概念持有不同的看法。为了反映这种差异,遵循RCT\[29 (https://arxiv.org/html/2609.17847#bib.bib6)\],我们将判断建模为两个相互作用组件的结果:
1. 1\.决策者属性\(d\):影响美学判断的个体的稳定特征,例如个性、过往经验、领域专业知识和长期品味。
2. 2\.决策任务\(t\):评估任务以及选项的可观察属性\(o\)。在我们举的例子中,任务是判断“运动感”,而选项由其视觉属性(例如,颜色、形状、车身样式)表示。
形式化地,令\(d\in\mathcal{D}\)表示决策者,\(t\in\mathcal{T}\)表示决策任务,\(o\in\mathcal{O}\)表示候选选项。我们考虑包含两个选项的二元选择任务,
\[\mathcal{O}_t=\{o_1,o_2\}.\]
在RCT下,每个决策者被假定拥有一个潜在的效用函数
\[u:\mathcal{D}\times\mathcal{T}\times\mathcal{O}\rightarrow\mathbb{R},\]
其中\(u(d,t,o)\)表示在任务\(t\)下决策者\(d\)赋予选项\(o\)的主观效用。该效用函数捕捉了决策者的潜在属性与决策情境之间的相互作用,为每个候选选项分配一个标量值。
对于二元选择,
\[u_1=u(d,t,o_1),\qquad u_2=u(d,t,o_2),\]
决策者选择效用最高的选项,
\[o^*=\arg\max_{o\in\{o_1,o_2\}}u(d,t,o).\]
然而,由于未观察到的因素、有限理性和测量不确定性,观察到的人类决策本质上是随机的。因此,我们使用随机效用模型对成对选择进行建模,其中选择某个选项的概率由其相对效用决定,
\[P(o_1\succ o_2\mid d,t)=\frac{\exp(u_1)}{\exp(u_1)+\exp(u_2)}=\sigma(u_1-u_2),\]
其中\(\sigma(\cdot)\)是逻辑斯蒂sigmoid函数。对于机器学习,目标是从给定数据集中的观察到的成对比较中推断出潜在的主观效用函数。
#### 与现有偏好学习的关系。
一些现有的偏好学习方法采用了更简单的生成假设。他们不将效用条件化于决策者,而是假设一个仅依赖于任务和候选选项的通用效用函数\(u=u(t,o)\)。成对比较则使用Bradley-Terry似然\[1 (https://arxiv.org/html/2609.17847#bib.bib15)\]建模,
\[P(o_1\succ o_2\mid t)=\frac{\exp(\beta u(t,o_1))}{\exp(\beta u(t,o_1))+\exp(\beta u(t,o_2))},\]
其中\(\beta>0\)是逆温度参数,控制观察到的选择的随机性。
在这种形式化下,所有标注者被假定评估相同的潜在效用函数。因此,标注者之间的分歧被解释为随机波动,其变异性被逆温度参数\(\beta\)吸收,而不是归因于系统性差异。因此,学习到的奖励模型近似于
\[\hat{u}(t,o)\approx\mathbb{E}_{d}\left[u(d,t,o)\right],\]
其中\(\mathbb{E}_{d}\)是期望算子,它有效地对异质的决策者取平均。相比之下,我们的形式化主张效用本身在不同决策者之间是变化的。
## 4学习个体化效用函数
参见图1标题图1:提出的个体化效用学习架构概述。给定决策者\(d\),任务\(t\),和候选选项\(o_1\)和\(o_2\);(1)表示:特定模态的编码器将决策者、任务和每个候选选项转换为潜在表示,这些表示被连接成向量。(2)评估:一个效用网络估计每个选项的潜在效用。两种评估设计是相似文章
大型语言模型应学习个性化而非聚合的人类偏好
这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。
基于LLM的偏好判断缺乏自一致性
本文研究了基数型LLM偏好判断在多个模型中的自一致性,发现了显著且持续的不一致性,表明它们无法被单一效用函数忠实总结。
内部多元主义与成对比较的局限性
本文批判了使用成对比较来学习人类偏好的方法,认为内部多元主义(多种相互冲突的优先级)削弱了标准方法。它提出了一个形式化模型,并建议允许犹豫不决可以提高学习效率。
多智能体协商中基于对手建模的偏好估计
本文提出了一种新颖的偏好估计方法,将大型语言模型(LLM)的自然语言信息集成到结构化贝叶斯对手建模框架中,用于多智能体协商。该方法利用LLM从话语中提取定性线索,并将其转换为概率格式,在多方协商基准上展示了改进的协议达成率和偏好估计准确性。
面向偏好变化的记忆检索
本文提出了一种针对长上下文对话系统中记忆访问与选择的统一框架,利用贝叶斯因子量化历史轮次对建模变化用户偏好的效用。实验表明,在偏好密集型任务中,该框架优于基于嵌入的检索方法。