内部多元主义与成对比较的局限性
摘要
本文批判了使用成对比较来学习人类偏好的方法,认为内部多元主义(多种相互冲突的优先级)削弱了标准方法。它提出了一个形式化模型,并建议允许犹豫不决可以提高学习效率。
arXiv:2607.02672v1 公告类型:新
摘要:局部成对比较是学习人们希望决策规则如何运作的标准工具,例如在参与式设计或对齐中。然而,它们的使用建立在两个强有力的假设之上:局部比较足以证明一个人希望自动决策规则如何行为,并且人们总是能够果断地回答这些比较。我们研究了在内部多元主义下这些假设可能会受到损害的情况:内部多元主义是指一个人根据关于规则应该如何行为的多个权威优先级来评估决策规则。我们提供了这种关于决策规则的多元偏好的形式化模型,从而识别出强制局部成对比较数据的两种不同失败。首先,诸如比例性、平等主义和同等待遇等优先级本质上是全局性的:它们在一个案例中的含义可能取决于其他地方发生的事情,因此局部比较可能无法捕捉到它们。其次,即使优先级可以在局部表示,强烈持有优先级之间的紧张关系也会产生内部冲突,当被迫进行比较时,可能会产生代价高昂的行为扭曲。然后,我们利用模型研究了另一种选择——允许人们报告犹豫不决——我们的发现表明,这样做可以显著减少准确学习偏好所需的查询次数。最后,我们描述了我们的模型如何指向直接引出这些优先级的偏好学习方法,从而更忠实地、可解释地描述人们所重视的东西。
查看缓存全文
缓存时间: 2026/07/07 04:34
# 内部多元主义与成对比较的局限性 来源:https://arxiv.org/html/2607.02672 ###### 摘要。局部成对比较是了解人们希望决策规则如何运作的标准工具,例如在参与式设计或对齐中。然而,它们的应用建立在两个强有力的假设上:局部比较足以证明一个人希望自动决策规则如何行为,并且人们总是能够果断地回答这些比较。我们研究了在**内部多元主义**下这些假设可能受到损害的方式:内部多元主义认为,个体根据多个关于规则应如何行为的权威优先级来评估决策规则。我们提供了一个关于决策规则的这种多元偏好的形式模型,然后让我们识别出强迫性局部成对比较数据的两种不同失效。首先,诸如比例性、平等主义和平等待遇等优先级本质上是**全局性的**:它们在一个案例中的含义可能取决于其他案例中发生的事情,因此局部比较可能无法捕捉到它们。其次,即使优先级可以在局部表示,强烈持有的优先级之间的紧张关系也可能产生内部冲突,在强制比较时产生潜在代价高昂的行为扭曲。然后,我们利用模型来研究替代方案——允许人们报告犹豫不决——我们的发现表明,这样做可以大大减少准确学习偏好所需的查询次数。最后,我们描述了我们的模型如何指向直接引出这些优先级的偏好学习方法,从而产生对人们价值观更忠实和可解释的描述。††会议:;;###### 目录 1. [引言](#S1) (https://arxiv.org/html/2607.02672#S1) 2. [模型](#S2) (https://arxiv.org/html/2607.02672#S2) 3. [泛化#1:不可分离性](#S3) (https://arxiv.org/html/2607.02672#S3) 4. [泛化#2:潜在犹豫不决](#S4) (https://arxiv.org/html/2607.02672#S4) 5. [讨论](#S5) (https://arxiv.org/html/2607.02672#S5) 6. [参考文献](#bib) (https://arxiv.org/html/2607.02672#bib) 7. [来自第2节的补充材料](#A1) (https://arxiv.org/html/2607.02672#A1) 8. [来自第3节的补充材料](#A2) (https://arxiv.org/html/2607.02672#A2) 9. [来自第4节的补充材料](#A3) (https://arxiv.org/html/2607.02672#A3) 致谢。感谢Serena Wang、Kate Donahue和Chara Podimata对本文的详细反馈。感谢Finale Doshi-Velez、Charis Pipis、Daniel Lee、Jakob de Raaij、Marina Mancoridis、Sarah Bentley、Colin Camerer和Maxon Rubin-Toles对本文相关演示的反馈。感谢Bernardo Zacka、Carmel Baharav、Elias Bareinboim和Andre Ye的有益讨论,也感谢Vijay Keswani和Min Kyung Lee提供数据访问权。 ## 1.引言 在参与式设计和AI对齐等领域,越来越感兴趣尝试将人类价值观嵌入到用于做出社会决策的自动化系统中。现有工作考虑了如何设计模仿人类判断的算法,例如,在电车难题中,由自动驾驶车辆驱动([Awad等,2018](https://arxiv.org/html/2607.02672#bib.bib122);[Noothigattu等,2018](https://arxiv.org/html/2607.02672#bib.bib121));如何优先考虑谁应该接受肾脏([Freedman等,2020](https://arxiv.org/html/2607.02672#bib.bib127);[Keswani等,2024](https://arxiv.org/html/2607.02672#bib.bib220),[2025a](https://arxiv.org/html/2607.02672#bib.bib212);[Boerstler等,2024](https://arxiv.org/html/2607.02672#bib.bib169);[Cousins等,2025](https://arxiv.org/html/2607.02672#bib.bib192));如何向食品银行分配食物([Lee等,2019](https://arxiv.org/html/2607.02672#bib.bib244),[2017](https://arxiv.org/html/2607.02672#bib.bib298));LLM应如何回应提示([Ge等,2024a](https://arxiv.org/html/2607.02672#bib.bib99);[Huang等,2024](https://arxiv.org/html/2607.02672#bib.bib168));如何假设性地分配救生衣([Mohsin等,2022](https://arxiv.org/html/2607.02672#bib.bib207));以及如何向医疗患者分配资源([Johnston等,2023](https://arxiv.org/html/2607.02672#bib.bib213);[Dieteren等,2022](https://arxiv.org/html/2607.02672#bib.bib296);[Gatto等,2026](https://arxiv.org/html/2607.02672#bib.bib1))。我们将此类通用设置称为**决策任务**,由一组固定的决策输入 \( \mathcal{X} \) 和决策输出 \( \mathcal{Y} \) 组成,在 \( x \in \mathcal{X} \) 处的有效决策输出为 \( \mathcal{Y}(x) \subseteq \mathcal{Y} \)。**决策规则** \( F: \mathcal{X} \to \mathcal{Y} \) 是任何用于在给定任何输入时选择输出的自动化规则。例如,在电车难题的一个简单版本中(我们的运行示例),输入 \( x \in \mathcal{X} \) 由一个电车场景和两组人 \( N_1, N_2 \) 组成;决策规则必须选择 \( \mathcal{Y}(x) = \{N_1, N_2\} \) 中的一组来拯救。令决策规则集 \( \mathcal{F} \) 为所有从 \( \mathcal{X} \to \mathcal{Y} \) 的映射的集合。目标是学习一个与个体或群体最“对齐”的决策规则 \( F \in \mathcal{F} \); 在本文中,我们专注于将决策规则与**单个个体**对齐。 在上述应用中,使此类对齐问题在经验上可行的常见方法是引出**局部成对比较**,它询问:给定输入 \( x \in \mathcal{X} \),你更喜欢规则输出 \( y \) 还是 \( y' \)(其中 \( y, y' \in \mathcal{Y}(x) \))?[^1] 这些比较通常是**强制性的**,即个体必须选择其中一个选项。在收集了许多这样的比较后,学习器拟合一个选择模型——通常基于 Bradley-Terry ([Bradley 和 Terry, 1952](https://arxiv.org/html/2607.02672#bib.bib368)) 或相关的随机效用模型——其诱导的选择尽可能忠实地再现个体的回答。 这种方法反映了两个重要且可能非中性的假设。首先,它将局部成对比较视为学习关于实际决策空间 \( \mathcal{F} \) 偏好的充分证据。然而,很容易出现这样的情况:人们关于规则应如何运作的信念有时作用于**整个规则**,无法在单个输入上分解:例如,有人可能希望规则避免对受保护群体施加不成比例的伤害(我们称之为**比例性**)。根据比例性,在 \( x \) 处谁应被拯救关键取决于在 \( x' \in \mathcal{X} \setminus \{x\} \) 处谁被拯救——当个体回应局部成对比较时,这种依赖性必须以某种方式消除。我们将此类信念称为**不可分离的**,因为它们在单个 \( x \) 处规定的回应无法与其他输入上的决策分离。 第二个关键假设是人们总是能够对局部成对比较查询给出果断回答。我们基于**内部多元主义**质疑这一假设:这是一个广泛讨论的观点,即个体的判断可能源于多种核心价值或目标,这些价值或目标可能因艰难的权衡而产生不可调和的冲突。例如,如果被问及在电车案例中决策规则应如何运作,个体可能会阐述多个优先级:除了比例性之外,他们可能希望规则拯救尽可能多的人(称之为**规模**优先级),并拯救他们的直系亲属(称之为**家庭**优先级)。这些优先级很容易陷入冲突:例如,在经典困境中,\( N_1 \) 包含1000人,但 \( N_2 \) 包含个体的母亲,规模和家庭优先级强烈主张相反的回答,个体可能无法产生道德上权威的决策。在这种情况下,强制做出果断回应最多会抹去这种潜在的内部冲突,最坏的情况下可能促使个体任意回应,导致回应不一致和学习者得出错误结论。 使用一个捕捉此类多元优先级的正式模型,我们形式化了这两个担忧:我们研究了不可分离的信念如何被局部成对比较抹去,以及即使没有这个问题,这些优先级之间的内部冲突如何在强制比较下导致误设。我们的目的不是拒绝成对比较作为引出工具,而是理解它们何时能够忠实地反映人们对规则应如何运作的看法,何时不能。这三个贡献——加上我们的模型如何作为学习工具应用——在下面的I-IV中描述。 **贡献I:优先级的多元模型(第2节)**。我们的第一个贡献是引入这个正式模型,如图1所示。该模型的核心特征是它代表了**内部多元主义**:个体关于规则应如何运作的信念不是由规则上的单一偏好排序来表示,而是由规则上的一组**各自权威的偏好排序**来表示。我们称这些排序为**优先级**。每个优先级代表个体评估规则的一种连贯方式,例如拯救尽可能多的人、保护家庭成员或避免对受保护群体造成不成比例的伤害。形式上,设 \( m \in \mathbb{N} \) 个优先级,每个优先级由 \( \mathcal{F} \) 上的一个完备的、传递的且弱偏好关系表示。对于给定的优先级 \( j \in [m] \),我们用效用函数 \( u_j: \mathcal{F} \to \mathbb{R} \) 对此关系建模。注意,当只有一个优先级时,这捕捉了单目标情况。
**图1**。决策规则上优先级模型的描述。每个优先级由规则空间上的一个弱、完备、传递的偏好关系表示。在图中,圆圈表示 \( \mathcal{F} \) 的子集,个体对其中的规则无差异;因为排序是完备的,每一行圆圈代表 \( \mathcal{F} \) 的一个划分,例如,\( \mathcal{F}_1 \cup \mathcal{F}_2 \cup \mathcal{F}_3 = \mathcal{F} \)。在应用于电车示例的**规模**优先级中,\( \mathcal{F}_1 \) 可能代表所有规则中,只要两组人数不同,就选择拯救最多人数的规则集合。
有了这个多元优先级模型,我们随后正式建模这些规则级优先级如何被转化为对局部成对比较查询的回应。这就是上述两个担忧正式出现的地方。首先,单个优先级可能是**不可分离的**:它在输入 \( x \) 处对输出 \( y \) 与 \( y' \) 的说法可能取决于规则在其他输入上的行为。然后,为了确定局部查询回应的要求,个体必须以某种方式根据规则在其他输入上可能的行为来合并竞争性证据。其次,即使每个优先级可以单独评估局部查询,跨优先级的证据仍然可能无法支持果断回答。一些优先级可能提供在 \( x \) 处选择 \( y \) 的证据,而另一些优先级则提供选择 \( y' \) 的证据,从而产生**冲突**(例如,在选择拯救你的母亲还是1000人的电车困境中)。或者,没有优先级为 \( y \) 或 \( y' \) 提供有意义的证据,从而产生**无差异**(例如,在选择拯救一个旧三明治还是塑料袋的电车困境中)。我们将这些冲突和无差异状态称为**潜在状态**,允许它们在行为上的表现方式变化。因此,在其完全一般性中,我们的多元优先级模型既捕捉了不可分离的优先级,也捕捉了犹豫不决的潜在状态——这两个组成部分我们担心标准成对学习流程可能无法捕捉。 我们也用我们的模型形式化了这一直觉:我们表明,标准的**基于分数的随机效用模型**(S-RUM),包括 Bradley-Terry,正好对应于我们框架的一个特殊情形,其中两种复杂性都消失了。在这种特殊情形中,优先级是**完全可分离的**,因此在 \( x \) 处的局部证据与规则在其他地方的行为无关;此外,所有证据都被简化为单个分数差异,任何“犹豫不决”都简化为果断回应之间的噪声。形式上,我们表明我们模型的这些限制使得潜在无差异和冲突在行为上无关紧要,因此强制比较在机械上是合理的。对于贡献2和3,我们从恢复S-RUM的模型特殊情形开始,然后分别研究放松每个限制的效果:首先允许优先级不可分离,然后允许局部查询产生潜在无差异或冲突。 **贡献II(第3节)**。我们首先分离出允许优先级不可分离的后果。我们表明,自然的优先级类别,包括比例性、平等主义和平等待遇,满足强不可分离性概念。然后我们表明,在标准流程中,这些不可分离的优先级可能被抹去或错误解释,导致学习系统推断出高度次优的规则。更具体地,我们首先证明,当假设完全可分离性时,最强烈不可分离的优先级被毫无痕迹地抹去,而且即使事先知道它们存在的可能性,它们的存根本**无法通过局部成对比较识别**。对于那些原则上可识别的不可分离优先级,我们表明,由于对不可分离证据的错误解释,假设可分离性的学习者的推断可能被系统性地扭曲。通过这种方式,不可分离性为成对比较数据中的明显不一致性提供了一种正式解释:这种不一致性可能反映了不可分离的规则级优先级与局部引出之间的不匹配。 **贡献III(第4节)**。然后我们分离出允许局部查询产生潜在无差异和冲突的后果。我们在模型的一个线性特殊情形中做到这一点,其中优先级存在于已知的特征空间中,每个优先级主张单个特征的重要性。我们模型这个可分离的限制捕捉了线性社会选择([Ge等,2024a](https://arxiv.org/html/2607.02672#bib.bib99),[2026](https://arxiv.org/html/2607.02672#bib.bib22))和相关的基于特征的偏好学习模型([Lee等,2019](https://arxiv.org/html/2607.02672#bib.bib244);[Freedman等,2020](https://arxiv.org/html/2607.02672#bib.bib127);[Ge等,2024b](https://arxiv.org/html/2607.02672#bib.bib188);[Noothigattu等,2018](https://arxiv.org/html/2607.02672#bib.bib121);[Boerstler等,2024](https://arxiv.org/html/2607.02672#bib.bib169)),但通过保留每个特征的证据来严格推广它们。
[^1]: 成对比较是对齐语言模型和更简单决策规则的偏好学习中的主要模态(例如,[Jiang等,2024](https://arxiv.org/html/2607.02672#bib.bib167))。局部成对比较也是经济学、政治学、医疗保健、市场营销和交通运输中离散选择引出方法的更广泛传统的一部分([Ben-Akiva 和 Lerman, 1985](https://arxiv.org/html/2607.02672#bib.bib34); [Green 和 Srinivasan, 1978](https://arxiv.org/html/2607.02672#bib.bib92); [Hainmueller等, 2014](https://arxiv.org/html/2607.02672#bib.bib110); [Lancsar 和 Louviere, 2008](https://arxiv.org/html/2607.02672#bib.bib91))。相似文章
隐藏的共识:人类反馈中的偏好有效性压缩
本文认为,标准RLHF将人类偏好标量化的做法导致多个有效解释被压缩为单一目标,从而在文化多元的社会中错误衡量对齐。通过对马来西亚数据集的分析,研究发现79%的提示词存在多个多数支持的回答,而这些回答在单一胜者聚合中被丢弃。
高效获取集体分歧
介绍了一个分层框架,用于识别计算分歧度量所需的最小汇总偏好信息,提出了 plurality matrix,并证明成对比较是不够的;设计了获取协议,在参与者数量与认知负荷之间进行权衡。
在预测人们的偏好时,考虑“三的力量”大有裨益
MIT研究人员在一篇论文中表明,使用三元比较而非两两比较,可以显著提高预测人类偏好的随机效用模型的准确性。
LLM后训练中应比较哪些配对?
本文研究了LLM后训练中如何选择需要标注的完成对以供人类偏好反馈的问题。它将比较筛选问题形式化为采样设计问题,给出了DPO策略最优性差距的理论上界,并提出了实用的采样设计方案,在合成和真实基准测试上比常规启发式方法更有效地提高了样本效率。
长期决策问题中基于成对偏好的强化学习
本文介绍了Markov decision contest,这是一种用于基于成对偏好的强化学习的新问题模型。它证明了平稳策略的最优性保证、在P中的精确可解性,并提出了一种高效学习的近似算法。