Rushes:一个用于多元对齐的人类偏好数据集

arXiv cs.CL 论文

摘要

介绍Rushes,一个大规模数据集,记录了人类在AI生成的分支叙事中的参与偏好。结果表明,当前如GPT-5等大语言模型在预测用户选择方面甚至无法超越简单基线,凸显了个性化对齐的必要性。

arXiv:2607.20767v1 Announce Type: new 摘要:我们介绍了Rushes,一个用于研究交互式叙事环境中人类参与偏好(revealed engagement preferences)的数据集和基准。Rushes通过一个游戏界面收集,用户在其中与AI生成的分支叙事进行交互,并在每个决策点从一个小型显式候选项集中选择一个选项。每次交互记录完整的候选项集、用户的选择以及不断演变的叙事上下文,从而生成带有持久用户标识符的时序轨迹。Rushes包含来自8,167名独立用户在六个游戏中的44,226个决策事件,捕获了序列化、个性化的参与行为,而非静态判断。我们证明用户选择表现出结构化的非随机模式,通过相对于均匀基线的低选择熵进行量化。我们将Rushes定位为多元对齐(pluralistic alignment)的诊断基准,并展示了一个显著的参与差距(Engagement Gap):最先进的大语言模型(包括GPT-5)未能超越简单基线。经典的矩阵分解(SVD)能捕获可衡量的个性化信号(37.7%),而前沿大语言模型(34.23%)在事件级选择预测上甚至难以匹配流行度基线(36.4%)。这一差距表明,单一的、群体层面的目标(如现代RLHF中所使用的)似乎不足以捕捉异质性的、依赖上下文的参与信号。因此,即使能力很强的模型也会默认遵循多数偏好,而非适应个体轨迹。我们发布Rushes以支持生成系统中的多元对齐和序列决策研究。平台和数据集的完整代码将在此处提供:https://github.com/microsoft/rushes
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:17

# Rushes: 一个用于多元对齐的人类偏好数据集
来源:https://arxiv.org/html/2607.20767
Michael Xu Jorge Leandro Sudha Rao Weijia Xu Nebojsa Jojic Gabriel DesGarennes Chris Quirk Bill Dolan
Microsoft Research
michaelxu@microsoft\.com

###### 摘要
我们介绍了 Rushes,一个用于研究交互式叙事环境中已揭示的人类参与偏好的数据集与基准。Rushes 通过一个游戏界面收集数据,用户在界面中与 AI 生成的分支叙事互动,并在每个决策点从一个小型、明确的候选集中选择一个选项。每次互动会记录完整的候选集、用户的选择以及不断演进的叙事上下文,从而生成带有持久用户标识符的时序轨迹。Rushes 包含了来自 8167 名用户在六款游戏中的 44226 个决策事件,捕捉了序列化、个性化的参与行为,而非静态的评判。我们发现用户选择呈现出结构化、非随机的模式,表现为平均选择熵低于均匀四选项基线。我们将 Rushes 定位为多元对齐的诊断基准,并揭示了一个“参与度差距”:包括 GPT-5 在内的最先进 LLM 并未超越简单基线。一个基于 SVD 的矩阵分解模型捕捉到了可测量的个性化信号(37.7%),而带有用户历史记录的 GPT-5 在事件级选择预测上仅达到 34.2%,低于流行度基线的 36.4%。这一差距表明,现代 RLHF 中使用的群体级目标可能不足以捕捉异质的、依赖于上下文的参与信号。因此,即使能力很强的模型也可能会默认采用多数偏好,而非适应个体轨迹。我们发布 Rushes 以支持关于多元对齐以及生成式系统中序列决策的研究。

Rushes: 一个用于多元对齐的人类偏好数据集
Michael Xu Jorge Leandro Sudha Rao Weijia Xu Nebojsa Jojic Gabriel DesGarennes Chris Quirk Bill Dolan
Microsoft Research
michaelxu@microsoft\.com

## 1 引言

关于大型语言模型(LLM)的基础工作主要集中在能力和安全性上,由奖励有用和无害输出的数据集所规范。在安全研究和实践中,目标通常是“收敛”:为所有用户最小化危害。然而,娱乐领域(如游戏、电影或书籍)为模型开发引入了一个正交维度。此处的目标是“发散”:为特定个体最大化“趣味性”和“乐趣”。学习如何让体验对不同用户的主观维度变得有意义,在具有多个有效目标的应用中至关重要。个性化的参与概念要求多元对齐,即模型适应多样的人类价值观,而非坍缩到单一均值。

然而,当前的校准方法常常无法捕捉这种主观性。正如 Ali 等人(2025)所指出的,将多样化的偏好聚合到一个单一的奖励模型中会压制少数群体的观点,导致输出千篇一律。此外,上下文历史在这些设置中扮演着重要角色,因为先前的用户选择可以指导后续的模型预测。据我们所知,目前尚无大规模的人类偏好数据集同时解决参与度对齐、序列决策和个性化建模问题。

我们提出 Rushes,一个围绕人类对 AI 生成分支叙事(包含文本、图像、视频和音频旁白)的反应而构建的数据集与基准。

**参与度差距:** 我们的实验揭示了当前前沿模型的一个关键局限性。在预测 Rushes 中用户选择的任务中,诸如 GPT-4o(OpenAI, 2024)和 GPT-5(OpenAI, 2025)等模型并未超越简单的流行度启发式方法。这反映了推荐系统中的流行度偏差,但突出了 LLM 中一种独特的失败模式:它们被微调为“普遍可接受”而非“个人动心”。Castricato 等人(2025)近期在 PERSONA 基准上的工作已经开始使用合成用户代理来解决这个问题。Rushes 用来自人类轨迹的有机的、已揭示的偏好补充了这种合成方法,捕捉了参与度中嘈杂且隐含的本质。

图 2:决策点上用户投票熵的分布。虚线标记了均匀分布在四个选项上的熵(典型候选集大小)。观察到的平均熵低于此基线,表明存在结构化、非随机的选择行为,但并不意味着收敛到单一主导结果。

图 LABEL:fig:teaser 提供了用于收集数据集的系统概览。我们创建了六款 AI 生成的游戏供用户游玩。每款游戏建立一个背景和情节,然后在分支点询问玩家接下来应该发生什么。用户从一个小的选项集中进行选择,通常为四个。所选选项被融入故事中,故事继续到下一个分支点。此过程重复进行,直到深度 4 的“一天”结束。由于故事是开放式的,系统可以在结束叙事之前生成额外的“日子”。在此投票过程中,我们记录所选选项、备选选项以及额外的元数据。无需支付或执行指令任务;用户参与是因为活动本身令人愉悦,从而产生反映自然、原位行为的偏好。

平均用户投票熵低于均匀四选项基线(图 2),表明偏好并非随机。这一观察结果与叙事评估的信息论方法一致,例如 Fabula Entropy Indexing(Castricato 等人, 2021),该方法认为高质量的叙事在人类问答任务中表现出低熵。

我们当前的数据集快照包含来自 8167 名用户在六款游戏中的 44226 个偏好投票。我们将 Rushes 定位为预测交互式叙事中个性化用户参与的基准。我们的贡献是:

1.  一种收集反映主观参与(包括乐趣和兴趣)的大规模、用户级偏好的方法;
2.  一个包含来自 8167 名用户在六款基于叙事的游戏(含多模态内容)中的 44226 个偏好投票的大规模数据集;
3.  一个全面的基准测试套件,使用协同过滤和最先进的 LLM 建立性能基线,识别出一个挑战当前对齐技术的“参与度差距”;
4.  用于生成管线的代码和提示,以及环境存档版本,将公开发布。

我们希望我们的发布能够支持对个性化对齐、参与度建模和交互式叙事创作感兴趣的研究人员。Rushes 被设计为在开放、多模态环境中研究人类偏好的试验平台。

## 2 相关工作

表 1:Rushes 与先前工作的比较。标准 RLHF 数据集侧重于安全性,没有纵向历史记录,而序列推荐 (SeqRec) 数据集跟踪的是项目 ID 而非叙事上下文。Rushes 将长期用户轨迹与丰富的多模态交互叙事相结合。

##### 交互式叙事与故事讲述基准
最近的交互式叙事基准包括 TextQuests(Phan 等人, 2025),它使用经典的交互式小说来评估代理的推理和规划能力。TextQuests 评估代理是否能解决谜题(能力),而 Rushes 评估模型是否能预测人类希望接下来发生的事情(参与度)。这种区别对于开发既具备能力又令人愉悦的代理至关重要。类似地,What-If(Huang 等人, 2024)和 Narrative Studio(Ghaffari 和 Hokamp, 2025)探索了分支叙事的生成机制。例如,Narrative Studio 采用蒙特卡洛树搜索(MCTS)在生成过程中最大化叙事多样性。Rushes 通过提供用于评估生成结果的“趣味性”的数据来补充这些以系统为中心的工作。尽管我们在生成管线(第 3.1 节)中采用了类似的语义多样性检查以避免冗余,但我们的主要贡献是在这些多样化的结构中捕捉已揭示的人类偏好,而非生成方法本身。

##### 个性化对齐与 RLHF
先前关于使大型语言模型(LLM)与人类偏好对齐的工作主要集中在安全性、帮助性或事实正确性等维度(Ouyang 等人, 2022;Bai 等人, 2022)。这些数据集通常缺乏个性化所需的纵向用户历史。最近的工作强调了个性化对齐中的“冷启动”问题,认为静态奖励模型无法捕捉不断变化的用户意图。LiteraryTaste(Chung 等人, 2025)在创意写作中解决了这个问题,发现明确的调查(“陈述偏好”)常常无法预测实际选择(“已揭示偏好”)。Rushes 通过行为而非调查来捕捉已揭示偏好。此外,LikeBench(Rahman 等人, 2025)使用模拟人物来测量好感度。Rushes 用人类轨迹补充了这项工作,人类的偏好通常比模拟代理的偏好更嘈杂且更依赖于上下文。

##### 戏剧管理与交互式叙事
经典的“戏剧管理器”(DMs)试图将正在进行的叙事适应于用户偏好,以最大化能动性或享受度(Yu 和 Riedl, 2013;Riedl 和 Bulitko, 2013)。然而,这些系统通常依赖于手工规则或符号规划器,难以扩展。尽管诸如 AI Dungeon(Walton, 2019)和层次化故事生成(Fan 等人, 2018)等神经方法展示了开放式文本生成的潜力,但它们常常缺乏个性化建模所需的结构化、纵向偏好数据。Rushes 通过使用 LLM 扩展环境规模来现代化这一目标。与在受限状态空间上运行的经典 DM 不同,Rushes 利用了前沿模型的开放式生成能力,同时以超过 44000 次交互的规模捕捉已揭示偏好。这些数据可以为现代基于 LLM 的戏剧管理提供用户模型支持。

##### 主观评估指标
对于标准奖励模型来说,衡量“趣味性”是困难的。WritingPreferenceBench(Ying 等人, 2025)证明,基于序列的奖励模型——RLHF 的标准——在主观写作任务上仅达到 52.7% 的准确率,勉强超过随机猜测。这一结果与我们的发现一致,即神经偏好模型在 Rushes 中难以击败流行度基线。这表明,对参与度进行建模可能需要架构创新,例如由 Ying 等人(2025)提出的“生成式奖励模型”,该模型能够推理风格和潜台词。

## 3 Rushes

### 3.1 游戏生成

#### 3.1.1 生成分支叙事文本
在当前版本中,所有叙事文本和决策选项均使用 GPT-4o 生成,温度为 0.3,并采用固定的提示模板(所有提示见附录 A)。所有生成的节点和选项在游戏开始前预先存储。每个故事从一个高层概要开始,该概要指定了预期的叙事轨迹,生成过程递归地将故事树扩展到深度 4,产生大约 330 个节点,这些节点可以在发布前进行人工审查。我们选择深度 4 是为了在简洁的叙事弧线和生成的计算可行性之间取得平衡。每个决策节点提供四个选项,这是为了平衡计算成本与足够的方差以捕捉不同的行为策略(例如,攻击性、外交性、探索性或被动性选择)而选择的分支因子。

##### 语义多样性强制
为了防止生成冗余选项(LLM 故事讲述中常见的失败模式),我们采用了语义相似性过滤器。在每个决策节点,基于 LLM 的检查器将候选选项与轨迹上的先前选项进行比较。如果该选项被认为过于相似(考虑动作类型、复杂性和叙事结果),则将其丢弃并重新生成。

##### 通过确定性释义实现词汇多样性
为了减轻词汇重复并阻止用户基于记忆的表面文本进行导航,我们在故事生成过程中为每个选项节点生成多个语义释义。变体的数量随树深度和每个节点的预期流量而变化,从而增加了高流量分支中的词汇多样性,同时限制了生成成本(见附录 A.2)。在运行时,系统使用用户匿名 ID 和节点标识符的哈希值确定性地选择一个变体。这为每个用户提供了稳定的词汇变化,同时保留了底层的动作语义,并避免了实时生成。

#### 3.1.2 生成图像、音频和视频
每个叙事节点都配有多模态资产以增强沉浸感。图像生成采用阶段式提示构建管线(元提示,类似于 Huang 等人(2024)),以提高角色一致性和风格连贯性。然后使用图像作为生成式视频模型的输入,利用 LTX-Video(HaCohen 等人, 2025)创建短视频片段。音频旁白使用具有表现力的 Azure Text-to-Speech (TTS) API 进行合成。

#### 3.1.3 生成叙事延续
为了支持多轮会话叙事,Rushes 能够在多个游戏“日子”中进行动态故事延续。在每一天结束时,我们识别所有活动叶节点。我们通过使用 LLM 将叶场景聚合成四个广泛的叙事类别来剪枝指数级扩展。然后,为每个活动节点生成与这些类别一致的自定义延续。

表 2:Azure 内容安全分析(N=3982)。四个维度上安全严重度分数的分布。严重度级别从 0(安全)到 6(高)。低严重度暴力标志的较高流行度反映了叙事类型中动作冒险的性质。

#### 3.1.4 质量控制与负责任 AI
所有生成的内容都通过自动化安全筛选管线(Azure Content Safety API),结果总结于表 2。在 3982 个筛选的生成内容中,系统在敏感维度上保持了严格的安全标准。绝大多数内容在“仇恨”(99.7%)、“性”(98.5%)和“自残”(99.0%)方面被分类为安全(严重度 0)。正如对一种充满动作的、以 da 开头的内容所预期的那样

相似文章

PLURAL: 面向价值对齐的全球数据集

arXiv cs.CL

介绍PLURAL,一个基于92个国家综合价值观调查的大规模偏好数据集,包含来自20个不同国家的约50万个偏好三元组,旨在改进大语言模型中的文化价值对齐。

从提示到行为对齐:用于推荐评估的个性化LLM评判器

arXiv cs.AI

本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。