从权重到文字:用自然语言表达和编辑偏好模型推理
摘要
介绍“从权重到文字”方法,该方法能从选择数据中自动发现以自然语言描述的领域相关偏好维度,使用户能够实时检查和编辑偏好模型推理。
arXiv:2607.16232v1 公告类型:新
摘要:越来越多地使用统计学习算法从高维选择数据中推断人类偏好,这面临一个根本性挑战:选择选项通常在多个方面同时存在差异,因此通常不清楚究竟是哪些因素驱动了观察到的决策,应将其视为偏好。更糟的是,这些方法的不透明性使得人类操作员无法在模型出错时进行检查、质疑或纠正。我们引入了\emph{从权重到文字}方法,该方法以选择问题数据集为输入,自动发现一组领域相关的偏好维度,每个维度都以自然语言描述,并与模型表示空间中的向量配对。这些维度同时解决了欠确定性和不透明性问题:它们可用于将归因集中于少量有意义的因素,并能以自然语言外化模型的推理,使用户能够实时检查和编辑它们。我们首先在四个不同领域(道德困境、电影、葡萄酒和自由形式的LLM回答)上定性地展示了该方法的通用性。然后,我们报告了两项预先注册的人类受试者实验,分别关于道德困境($N=450$)和电影选择($N=449$),证明了该方法在学习偏好模型方面的优势:(1)将偏好模型向学习到的基正则化,提高了对保留选择的预测准确性;(2)纳入参与者的结构化编辑进一步提高了准确性。在正面比较中,参与者更偏好该方法推断的偏好概况,并认为其预测更准确。
查看缓存全文
缓存时间: 2026/07/21 06:46
# 从权重到词语:用自然语言表达和编辑偏好模型推理 来源:https://arxiv.org/html/2607.16232 Zachary Wojtowicz Ayush Nayak Jacob Andreas MIT ###### 摘要 随着统计学习算法越来越多地被用于从高维选择数据中推断人类偏好,一个根本性挑战随之浮现:备选选项通常同时在许多方面存在差异,因此通常不清楚究竟是哪些因素实际驱动了观察到的决策,并应被视为偏好。使这一问题更加复杂的是,偏好模型推理的不透明性让人类操作者无法在模型出错时检查、质疑或修正它们。我们提出了*从权重到词语*(weights to words)方法,该方法以选择问题数据集为输入,自动发现一组领域相关的偏好维度,每个维度都用自然语言描述,并与模型表示空间中的一个向量配对。这些维度同时解决了欠定性和不透明性:它们可被用于将归因集中在少数有意义的因素上,并可将模型的推理以自然语言形式外化,使用户能够实时检查和编辑它们。我们首先在四个不同领域——道德困境、电影、葡萄酒和自由形式的大语言模型回复——中定性展示了该方法的通用性。然后,我们报告了两项预注册的人类受试者实验,分别关于道德困境(N=450)和电影选择(N=449),证明了该方法对学习偏好模型的益处:(1)将偏好模型向学习到的基正则化可提高对未见过选择的预测准确性,(2)结合参与者的结构化编辑可进一步提高准确性。在正面比较中,参与者更喜欢该方法推断出的偏好档案,并认可其预测更为准确。 ## 1 引言 当前对齐前沿AI系统的主流方法(以RLHF为代表;Christiano 等人,2017 (https://arxiv.org/html/2607.16232#bib.bib24))训练大型统计模型来预测人类选择数据,通常假设偏好可以用模型高维特征空间中的线性效用函数表示。尽管有许多优点,这种策略面临一个根本问题:从观察到的选择中推断高维偏好通常设定不当,因为备选选项同时沿着许多(可能有数千个)特征维度存在差异。当一个人在两个差异很大的选项之间做出选择时,究竟是哪个特征实际导致了该选择?这是 Kleinberg 等人 (2024 (https://arxiv.org/html/2607.16232#bib.bib23)) 称之为“反演问题”的更广泛挑战的一个方面:从观察到的行为推断潜在心理状态需要将意图与实现噪声、行为偏见、习惯、冲动、约束、情境影响以及无数其他也进入选择过程的因素分开。人类进行反演如此轻松,以至于我们甚至没有注意到它对社会推理有多么不可或缺。编码相关决策心理学的强归纳偏置有助于通过区分实际驱动选择的因素与备选项之间无数其他“无关紧要”的差异,将一个人的偏好与其选择分开。例如,我们凭直觉知道,一个选择就读布朗大学而非宾夕法尼亚州立大学的学生很可能偏好其小班规模和文科重点——而不是因为它在字母表中排在前面。然而,用于训练大语言模型和其他高维统计模型的标准 Bradley-Terry (Bradley and Terry, 1952 (https://arxiv.org/html/2607.16232#bib.bib25)) 偏好模型,当这些差异在共同特征空间中表示时,会将所有差异视为同样可能的贡献因素,而且通常不清楚如何对定义在神经网络生成的嵌入上的选择模型参数设置先验。 这些方法生成的分布式偏好表征的不透明性加剧了这一挑战,这种表征对用户来说基本上不可读,破坏了部署中的透明度、问责性、可质疑性和安全性。这种不透明性反映了一种更深层次的表征不匹配:模型“说”的是参数更新,而人类更擅长用自然语言解释和表达偏好——这种工具历经数千年演化,用于阐明我们的喜好、愿望和需求。具有讽刺意味的是,尽管大语言模型擅长解析语言并将其映射到内部表征,但将自然语言表达转化为潜在偏好表征(以及反向转化)的方法仍然不发达。RLHF和监督微调不仅在统计上低效,而且可能产生不仅错误而且明显不安全的泛化,正如最近关于涌现错位的工作所证明的那样。例如,一个微调为编写不安全代码的大语言模型推断自己应该在远超编码的领域表现恶意,甚至主张人类应该被AI奴役 (Betley 等人,2025b (https://arxiv.org/html/2607.16232#bib.bib20), a (https://arxiv.org/html/2607.16232#bib.bib21))。后一篇文章的作者称这些为“怪异泛化”,它们之所以违反直觉,正是因为模型权重空间中的梯度更新不受关于从选择数据中推导出“合理”推理的人类先验的约束。然而,正如我们在本文中所示,语言模型实际上在预训练期间学习了这样的先验:当被提示*用文本*解释选择时,大语言模型能可靠地阐述出合理、与领域相关的理由来解释观察到的选择。我们利用这种不对称性,从这些解释中提取一个可解释的、与领域相关的基,然后将其翻译回模型的表示空间,以便将其作为学习动态的结构性正则化器和一个可解释性桥梁。 ##### 贡献。我们提出了一个自动化流水线,它以选择问题语料库为输入,发现一个低维偏好维度基,该基既可以正则化学习,又可以构建如何从人那里引出反馈的结构。每个维度由偏好嵌入空间中的一个方向和一个相应的自然语言标签定义,这使其直接可解释。我们首先将该方法应用于四个选择领域——道德困境、电影、葡萄酒和大语言模型回复——来说明其通用性,并表明它能在无需领域特定调整的情况下为每个领域恢复出一个合理的基(第3节 (https://arxiv.org/html/2607.16232#S3))。然后,我们通过两项预注册的人类受试者实验——关于道德困境(N=450)和电影(N=449)——展示了这类基如何被应用于改进偏好学习。在这两个领域中,用基进行正则化的学习显著优于随机投影,并且自然语言反馈可以进一步提高预测准确性,并持续改进主观认可度(第5节 (https://arxiv.org/html/2607.16232#S5))。 ## 2 相关工作 标准的对齐流水线从成对比较中学习一个标量奖励,并通过强化学习或闭式目标对策略进行微调 (Christiano 等人,2017 (https://arxiv.org/html/2607.16232#bib.bib24); Ouyang 等人,2022 (https://arxiv.org/html/2607.16232#bib.bib7); Rafailov 等人,2023 (https://arxiv.org/html/2607.16232#bib.bib8))。由于二元偏好信息稀疏,一些近期工作通过例如子句范围内的错误类型标签来“稠化”信号 (Wu 等人,2023 (https://arxiv.org/html/2607.16232#bib.bib27))。我们从这部分文献中继承了BTL似然,但通过用自然语言引出反馈并将推断约束到一个低维、可解释的子空间来解决稀疏性问题。 越来越多的文献在模型表示中发现结构化的、人类可读的方向,并直接对其进行操作 (Belinkov, 2022 (https://arxiv.org/html/2607.16232#bib.bib35); Rimsky 等人,2024 (https://arxiv.org/html/2607.16232#bib.bib9); Casademunt 等人,2025 (https://arxiv.org/html/2607.16232#bib.bib31); Gandelsman 等人,2023 (https://arxiv.org/html/2607.16232#bib.bib26)),或用自然语言标注单个模型组件 (Hernandez 等人,2021 (https://arxiv.org/html/2607.16232#bib.bib33); Choi 等人,2024 (https://arxiv.org/html/2607.16232#bib.bib10))。Movva 等人 (2025 (https://arxiv.org/html/2607.16232#bib.bib37)) 专门将这些方法应用于已有人类判断标注的数据集中的“自下而上”特征标注。我们在这类工作(以及标准句子编码器,例如 Reimers and Gurevych, 2019 (https://arxiv.org/html/2607.16232#bib.bib11))的基础上,使用大语言模型来发现与偏好相关的方向。在这里,我们既对“自上而下”地发现有意义的维度感兴趣——这些维度尚未被自动化特征发现技术捕获——也对使用发现的特征来提高人类标注本身的效率感兴趣。 另一条平行的工作线认为,单一的通用奖励函数无法捕捉人类偏好的多样性,提出了分布式的、博弈论的或公理化的替代方案 (Siththaranjan 等人,2023 (https://arxiv.org/html/2607.16232#bib.bib5); Halpern 等人,2025 (https://arxiv.org/html/2607.16232#bib.bib3); Munos 等人,2024 (https://arxiv.org/html/2607.16232#bib.bib4); Ge 等人,2024a (https://arxiv.org/html/2607.16232#bib.bib2), b (https://arxiv.org/html/2607.16232#bib.bib18)),并组装大规模多元数据集 (Kirk 等人,2024 (https://arxiv.org/html/2607.16232#bib.bib6))。我们的贡献是互补的——发现一个共享的基,在其中可以更高效地学习个性化偏好模型。 最后,近期工作探索了从自然用户交互中进行后训练 (Park 等人,2024 (https://arxiv.org/html/2607.16232#bib.bib19); Jin 等人,2025 (https://arxiv.org/html/2607.16232#bib.bib28); Don-Yehiya 等人,2024 (https://arxiv.org/html/2607.16232#bib.bib30); Liu 等人,2025 (https://arxiv.org/html/2607.16232#bib.bib29); Stephan 等人,2024 (https://arxiv.org/html/2607.16232#bib.bib38)) 或关于用户偏好的自由形式对话 (Li 等人,2023 (https://arxiv.org/html/2607.16232#bib.bib34));我们的工作提供了偏好函数本身的结构化表示,可以与使用这些方法推导出的反馈信号相结合。 参见图示 图1:应用于道德困境的发现流水线。(a) 对于每个选择问题 \(x,a,a'\),(b) 大语言模型生成自由文本理由来支持每一方 \(a/a'\)。(c) 大语言模型将这些理由浓缩为 \(K\) 个可解释维度,每个维度关联名称、摘要以及低端和高端极点(完整示例见表1 (https://arxiv.org/html/2607.16232#S3.T1))。(d) 通过拟合一个*逐维度* BTL 模型到成对大语言模型判断,每个选择沿每个维度 \(k\) 被赋予一个标量分数 \(s_k(x,a)\)。(e) 给定高维选择表示(例如大语言模型嵌入),我们通过从表示 \(\phi(x,a)\) 到分数 \(s_k(x,a)\) 拟合一个线性映射,找到编码每个维度的表示子空间。这些(选择维度、表示子空间)对可直接用于数据分析,指导对基于 \(\phi\) 的偏好模型的学习,或从人类那里引出更具信息量的偏好标注。 ## 3 方法 ### 3.1 预备知识 我们从支撑现代 RLHF 及相关方法的标准 Bradley–Terry–Luce (BTL) 随机偏好模型开始 (Bradley and Terry, 1952 (https://arxiv.org/html/2607.16232#bib.bib25); Rafailov 等人,2023 (https://arxiv.org/html/2607.16232#bib.bib8))。令 \(\mathcal{X}\) 表示*上下文*空间(例如道德困境描述),\(\mathcal{A}\) 表示*行动*空间(例如可以做的或说的回应)。一个*选择问题*是一个三元组 \((x,a,a') \in \mathcal{X} \times \mathcal{A} \times \mathcal{A}\)。我们假设一个固定的特征映射 \(\phi: \mathcal{X} \times \mathcal{A} \to \mathbb{R}^d\),由冻结的语言编码器给出。定义差异向量 \[ \delta(x,a,a') \;=\; \phi(x,a) - \phi(x,a') \; \in \; \mathbb{R}^d. \quad (1) \] 一个线性效用 \(u_\theta(x,a) = \theta^\top \phi(x,a)\) 其中 \(\theta \in \mathbb{R}^d\) 引出了 BTL 似然:一个标注者的二元标签 \(y \in \{0,1\}\),其中 \(y=1\) 表示 \(a \succ a'\),分布为 \[ y \mid x,a,a' \;\sim\; \mathrm{Bernoulli}\!\left( \sigma\bigl( \theta^\top \delta(x,a,a') \bigr) \right), \quad (2) \] 其中 \(\sigma(t) = (1+e^{-t})^{-1}\) 是逻辑函数。¹¹特征映射的选择在第3.4节 (https://arxiv.org/html/2607.16232#S3.SS4) 中讨论。 给定一个有限的选择问题和标签集合,本文的目标是学习一个能尽可能准确预测新选择上人类判断的 \(\theta\)。 表1:三个大语言模型发现的偏好维度示例,对应的极点描述,以及一个由大语言模型生成的具有该偏好的“典型用户”(均由方法生成)。每个领域的完整维度列表见附录A (https://arxiv.org/html/2607.16232#A1)。 ### 3.2 自动发现领域相关的语义特征 我们假设,在许多日常选择领域中,偏好主要由相对较小的一组因素驱动,这些因素跨越环境特征空间中的一个低维子空间,我们称之为*领域相关子空间*。给定一个领域中的 \(N\) 个选择描述语料库(以及它们的编码器嵌入),我们的方法自动发现一个基 \(V = [v_1, \dots, v_K] \in \mathbb{R}^{d \times K}\),包含 \(K \ll d\) 个命名的方向,这些方向在环境特征空间 \(\mathbb{R}^d\) 的一个子空间内定义了一个人类可读的坐标系。该流水线分五个阶段运行,在图1 (https://arxiv.org/html/2607.16232#S2.F1) 中进行了概述。 1. 1.分层对采样。我们从语料库中抽取 \(S\) 个选项对,按嵌入 \(\phi(x,a)\) 之间的余弦距离分层。分层确保引出的理由覆盖所有可能的合理分歧范围。 2. 2.理由引出。对于每一对 \((a,a')\),我们提示一个大语言模型生成固定数量的自由文本理由来选择 \(a\),以及相同数量的理由来选择 \(a'\),这些理由以领域的框架呈现(例如,“哪个行动更道德?”)。输出是一个自由文本理由池。完整的提示模板(用于此步骤及后续步骤)可在附录G (https://arxiv.org/html/2607.16232#A7) 中找到。 3. 3.维度浓缩。然后,通过大语言模型批量聚类,将理由池蒸馏成一组较小的规范主题。将顶级主题传递给一个大语言模型,该模型输出 \(K\) 个维度,每个维度都有一个名称,以及对与该维度低端和高端极点对齐的用户和选择的描述(示例见表1 (https://arxiv.org/html/2607.16232#S3.T1))。 4. 4.选项评分。对于每个维度 \(k = 1, \dots, K\),我们采样一组选项对 \(\mathcal{J}_k\),并拟合一个*维度特定*的 BTL 模型,恢复标量分数 \(s_k(a_n) \in \mathbb{R}\),作为以下问题的解: \[ \operatorname*{arg\,min}_{s_k} \sum_{(i,j) \in \mathcal{J}_k} -\log \sigma\left( (2 y_{ij}^{(k)} - 1) (s_k(a_i) - s_k(a_j)) \right), \]相似文章
"它们是由权重构成的"
一段创意对话探讨了大语言模型本质上只是权重矩阵的观点,挑战了关于理解和意识的概念。
In the Weights:你的全新 AI 虚荣搜索
In the Weights 是一个新网站,它查询多个 AI 模型以测试它们对一个人名字的记忆程度,提供 AI 时代的虚荣搜索。由前 OpenAI 设计师创建,该网站衡量一个人在各模型(如 GPT、Claude 和 Grok)中的“实力分数”。
Embeddings 用于偏好,而非语义
本文介绍了一种新的 embedding 模型,旨在捕捉偏好相似性,而不仅仅是语义相似性,从而提高了集体决策系统中的偏好预测能力。
Inkling:我们的开放权重模型
Thinking Machines AI 发布了 Inkling,这是一个新的开放权重混合专家多模态基础模型,总参数 975B,激活参数 41B,支持文本、图像、音频和视频,同时提供了 Inkling-Small 的预览。
CreativityNeuro:引导语言模型权重以提升发散性思维并减少模式崩溃
介绍CreativityNeuro,一种无需数据的方法,通过引导语言模型权重来增强发散性思维并减少模式崩溃,在不进行重新训练或微调的情况下,在创造力评估中实现了显著改进。