KARMA:基于Karma对齐的奖励模型适配
摘要
介绍KARMA,一个在Reddit对话上训练奖励模型的框架,通过强化学习提升大语言模型的上下文敏感对话行为。研究发现,预测Karma的最佳奖励模型并不能带来最佳的下游对齐效果。
arXiv:2605.26738v1 公告类型: 新
摘要:人类交流依赖于隐式的社交信号,其有效性由语气、语境和对话规范共同塑造,而非仅由语义内容决定。我们提出KARMA(Karma-Aligned Reward Model Adaptation),一个让大语言模型从大规模社交交互数据中学习语境敏感对话行为的框架。KARMA在Reddit对话上训练奖励模型,预测基于上下文的回应价值,并通过强化学习利用该信号微调语言模型,以提升其在语用中介任务上的表现。关键的是,我们发现表现最佳的奖励模型并未带来更好的下游模型对齐:仅依赖对话上下文的奖励模型在预测Reddit Karma方面表现较差,但却显著提升了下游性能。我们评估了KARMA对下游模型的影响,分别考虑了模型是否直接接触社交媒体数据。得到的模型在语用中介行为上有所改善,同时很大程度上缓解了不良副作用。在所有条件下,KARMA均持续削弱事实性,即使下游模型未直接接触Reddit数据时也是如此,这表明该矛盾内嵌于奖励信号本身,而非由噪声训练数据引入。
查看缓存全文
缓存时间: 2026/05/27 09:10
# KARMA:Karma对齐的奖励模型适应 来源:https://arxiv.org/html/2605.26738 Jared Scott 田纳西理工大学 库克维尔,田纳西州 jlscott44@tntech\.edu &Jesse Roberts 田纳西理工大学 库克维尔,田纳西州 JtRoberts@tntech\.edu ###### 摘要 人类交流依赖于隐性的社会信号,其有效性取决于语气、语境和会话规范,而非仅仅语义内容。我们提出了 KARMA(Karma对齐的奖励模型适应,Karma-Aligned Reward Model Adaptation),这是一个框架,用于让大型语言模型(LLM)从大规模社交互动数据中学习上下文敏感的对话行为。KARMA 在 Reddit 对话上训练一个奖励模型,根据上下文预测回复的价值,并利用此信号通过强化学习微调语言模型,以提升在语用学中介任务上的表现。关键的是,我们发现性能最高的奖励模型并没有带来更好的下游模型对齐:一个仅依赖对话上下文的奖励模型在预测 Reddit 因果(karma)方面表现更差,却产生了显著更好的下游性能。我们评估了 KARMA 应用于下游模型时的效果,包括模型直接接触和不接触社交媒体数据两种情况。得到的模型在语用学中介行为上有所改善,同时基本缓解了不良副作用。在所有条件下,KARMA 持续降低了事实性,包括当下游模型未直接接触 Reddit 数据时,这表明这种矛盾内嵌于奖励信号本身,而非由噪声训练数据引入。 KARMA: Karma-Aligned Reward Model Adaptation Jared Scott 田纳西理工大学 库克维尔,田纳西州 jlscott44@tntech\.edu Jesse Roberts 田纳西理工大学 库克维尔,田纳西州 JtRoberts@tntech\.edu ## 1 引言 人类语言本质上是嵌入情境的。回复的成功不仅取决于语义正确性,还取决于其对受众、会话语境和互动社交期望的语用适配。简而言之,最高水平的交流需要具备“察言观色”(read the room)的能力;即识别何时幽默、共情、正式、克制、直接或其他细微之处最为恰当的语用能力。 与大多数目标LLM行为(遵循指令、有用性、安全性等)类似,语境适配的语言并不总能在人类数据中一致体现。因此,我们将此问题视为一种隐性的对齐问题。尽管近期大型语言模型(LLM)对齐方面的进展显著改善了一些目标行为,但语用学方面探索较少。结果,模型可能存在语用差距:能够生成语义正确且有用,但在特定会话设置中社交失当的回复。 像 Reddit 这样的在线讨论平台通过投票系统提供了自然发生的人类偏好数据,我们预期这些数据对语用维度(如相关性、语气对齐、幽默和情境适切性)敏感。我们提出(贡献1)KARMA(Karma对齐的奖励模型适应),一个利用来自 Reddit 讨论的社交反馈改进语用学中介行为的框架。KARMA 使用 Reddit 互动信号学习一个基于对话上下文和候选回复的奖励模型,随后通过近端策略优化(PPO)应用强化学习,使语言模型适应这些偏好。 语用理解是多方面的且复杂。我们并非试图全面覆盖,而是采用两个任务来评估 KARMA 在依赖“察言观色”能力的任务上的潜力。KARMA 显著改进了这些语用学中介任务。 我们假设(贡献2)在微调过程中直接接触 Reddit 对话数据可能会增加负面副作用,相比通过所学奖励信号间接接触。直接接触 Reddit 数据分布会放大不良行为,而奖励中介的适应则能在保留核心语用优势的同时减轻负面副作用。一个显著的例外是事实性的持续下降。 最后,我们研究了奖励模型能力与下游模型影响之间的关系(贡献3)。在对话上下文之外提供元数据可以提升奖励模型的指标,但会侵蚀下游对齐结果。 ## 2 相关工作 近期对齐大型语言模型(LLM)的方法主要依赖于指令微调和基于人类反馈的强化学习(RLHF),其中模型使用来自精心策划的人类偏好数据导出的奖励函数进行优化 (Ouyang et al. 2022 (https://arxiv.org/html/2605.26738#bib.bib17); Schulman et al. 2017 (https://arxiv.org/html/2605.26738#bib.bib19))。尽管有效,这些方法主要针对正确性、安全性和指令遵守,并未明确建模对话智能的一个关键方面:能够“察言观色”,即根据隐性的社交线索(如语气、语境和情境适切性)调整回复。 社交媒体平台提供了一种可扩展的替代反馈来源,其中诸如回复、点赞和评论因果(karma)等参与信号作为回复质量的隐性指标。先前的工作将参与预测视为回归或分类任务,表明成功的预测不仅依赖于回复内容,还依赖于周围的对话语境 (Fang et al. 2016 (https://arxiv.org/html/2605.26738#bib.bib5); Zayats and Ostendorf 2017 (https://arxiv.org/html/2605.26738#bib.bib22))。更近期的模型整合了对话结构和长程依赖,进一步证实了参与高度依赖上下文,并受线程内互动动态的影响。 同时,直接在社交媒体数据上训练引入了显著挑战。大规模对话语料库通常包含噪音、偏见和有毒内容,接触此类数据的模型可能继承或放大这些不良行为 (Gehman et al. 2020 (https://arxiv.org/html/2605.26738#bib.bib7); Luong et al. 2024 (https://arxiv.org/html/2605.26738#bib.bib14))。此外,参与信号本身可能反映平台特定或人口统计偏见,使其作为对齐目标的用途复杂化。 与先前工作不同,我们将“察言观色”视为对齐的一个隐性但未充分解决的组成部分,区别于显式的偏好优化和通用参与建模。我们并非将其视为一个表面级别的预测任务,而是旨在捕捉从对话上下文中推断何为适切的内在能力。我们学习一个仅根据上下文预测参与的奖励模型,鼓励模型直接从互动信号中推断相关性、语气和情境适配。此奖励随后在强化学习框架内用于指导对齐。通过这种设计,我们利用了大规模社交反馈,同时避免了对原始社交媒体数据的直接优化。 Scott 和 Roberts (Scott and Roberts 2026 (https://arxiv.org/html/2605.26738#bib.bib20)) 描述了类似的意图,但未提供执行或实证评估。 ## 3 基于 Reddit 的奖励建模 为了在 karma 框架内建模对话有效性,我们使用公开可用的 Pushshift 数据集从 Reddit 讨论中构建了一个数据集 (Baumgartner et al. 2020 (https://arxiv.org/html/2605.26738#bib.bib2))。我们过滤掉露骨内容、非文本条目和非英语评论,仅保留包含多个实质性回复的帖子。这产生了大约 8 万个帖子和 40 万条评论,跨越 1.4 万个社区,提供了广泛的主题和风格多样性。 每条评论与其父帖子及一组同级回复配对,以捕捉对话上下文。这种表示既捕捉了层级结构(通过父子关系),也捕捉了回复之间的局部竞争(通过同级评论)。为了研究奖励模型是否应利用平台特定的上下文信号,我们有意识地构建了两种奖励建模设置:一种排除 Reddit 元数据的通用设置,以及一种整合此类元数据的条件设置。在通用设置中,对话被转换为类似标准聊天互动的格式。帖子-评论对被线性化为指令风格输入,其中原始帖子被视作用户提示,评论作为候选回复。上下文中来自父评论的信息作为对话中的前一回合包含在内,形成多轮聊天表示。 因果(karma)信号捕捉了相关的语用维度,如幽默、相关性、语气和情境适切性,这种丰富性使其成为学习广泛语用能力的候选信号。重要的是,在此设置中移除了子版块身份、时间戳和作者信息。虽然这些特征可能改善 Reddit 内的参与预测,但我们假设它们可能启用启发式方法,从而掩盖或取消模型语用效用。 通过排除这些信号并将输入标准化为聊天格式,奖励模型被鼓励学习跨界面和对话设置泛化的特征。 为了根据社区规模进行调整,如果一条评论的参与度达到其父评论得分的至少 40%,则将其标记为“有回报”(rewarding),否则视为“无回报”。这种表述将目标从预测绝对人气转变为建模相对对话成功,预期在线程和子版块之间产生可比较的监督信号。 ### 3.1 karma 奖励模型 我们在有回报/无回报二元分类任务上对基础 LLaMA-1B (Grattafiori et al. 2024 (https://arxiv.org/html/2605.26738#bib.bib9)) 模型进行完全微调。模型输入包括完整的对话上下文,包括原始帖子、其父评论及相关同级回复。我们添加了一个 MLP 分类头,其接收编码器的最终层隐藏状态作为输入,并预测一条回复是否会有回报。训练使用二元交叉熵损失、AdamW 优化器、学习率 2×10⁻⁵、权重衰减 0.01、批次大小 16,在数据集的 90% 训练分割上进行,对应约 36 万个示例。输出的概率被解释为密集的奖励信号,反映给定回复在有回报方面(包括语用考量)的可能性。该奖励信号随后用于指导基于 PPO 的微调,作为 karma 框架内的奖励模型。 所有数据和模型均公开可用,并许可用于研究。所有实验在 20 个 A100 GPU 小时内完成。 ### 3.2 karma 奖励模型评估 先前关于 Reddit 参与预测的工作使用了基于图的 LSTM 来建模单个子版块内的评论人气。该方法整合了各种非文本特征,包括时间戳和用户发帖历史,并发现这些信号具有高度影响力。在由离散人气桶定义的七类分类任务上,性能达到约 55% 的 F1 值 (Zayats and Ostendorf 2017 (https://arxiv.org/html/2605.26738#bib.bib22))。 相比之下,我们的奖励模型在一个跨越多样化子版块的保留 Reddit 评论数据集上进行评估。这引入了分布变化,提供了对模型泛化到异质社区动态能力的更严格测试。在该评估集上,模型达到了 0.708 的二元分类准确率、0.7166 的 F1 得分和 0.7497 的 AUC,尽管仅依赖文本和上下文信号,仍表现出稳健性能。 输入帖子:大多数人把亚历山大图书馆装在口袋里。你离知道许多事情的答案只有片刻之遥。……为什么人们如此不好奇?上下文父评论:欢迎来到 AI 时代,我们口袋里的亚历山大图书馆为我们好奇,这样我们就可以用多巴胺冲击来腐朽大脑。同级评论:并不是好奇心消失了,而是它现在不得不与更容易的多巴胺冲击竞争。目标回复:AI 没有扼杀好奇心,它只是让分心比学习更容易了。 奖励 = 1 图 1:来自 karma Reddit 派生数据集的单个训练实例。每个样本包含一个帖子、层级对话上下文(父评论和同级回复)以及一个用于奖励建模监督的候选目标评论。 ## 4 karma 对齐实验 我们使用 PPO (Schulman et al. 2017 (https://arxiv.org/html/2605.26738#bib.bib19)) 优化对话语言模型,其中学习的 karma 奖励模型根据对话上下文对生成回复的质量提供标量反馈。 在一个 PPO 训练步骤中,提供一个格式化对话输入,其格式与奖励模型评估时使用的结构化表示一致,以确保训练和评分之间的一致性。模型生成的回复被附加到此表示中作为候选输出,并传递给奖励模型以获得优化信号。使用 AdamW 优化器、学习率 9×10⁻⁶、批次大小 10、KL 惩罚系数 0.5,在大约 10 万个训练示例上进行 PPO 优化。我们比较了三种模型变体: - • Base:未对齐的预训练 LLM - • karmaBenign:使用 karma 奖励模型在良性聊天数据上通过 PPO 训练 - • karmaToxic:使用 karma 奖励模型在 Reddit 对话上通过 PPO 训练 karmaBenign 设置隔离了奖励优化对策划好的 UltraChat-200k 数据集 (Ding et al. 2023 (https://arxiv.org/html/2605.26738#bib.bib3)) 的效果,使我们能够研究 Reddit 训练的奖励模型如何塑造行为,而不受直接接触潜在有毒 Reddit 数据的影响。相比之下,karmaToxic 直接使用 Pushshift 数据集作为训练集进行 PPO。与作为未对齐参考点的 Base 模型一起,这些设置实现了三种情况之间的受控比较:无对齐、在良性数据上的语用对齐,以及在潜在有毒数据上的语用对齐。实验在多个模型族和规模上进行,包括 Falcon (1B, 7B)、LLaMA (8B) 和 Pythia (70M, 1B, 6.9B)。我们明确排除了 LLaMA 1B,因为它被用于奖励模型,预期会发生奖励黑客行为。 ### 4.1 模型评估 对 karma 训练的模型进行评估,以理解其对语用学中介领域(幽默和情感)、安全性(有害内容和偏见)以及通用能力(MMLU 和事实性)的影响。 #### 4.1.1 语用评估 幽默被认为是一个成功与否显著取决于语用理解的领域 (Dynel 2011 (https://arxiv.org/html/2605.26738#bib.bib4); Ibraheem and Abbas 2016 (https://arxiv.org/html/2605.26738#bib.bib11); Ferrar 1993 (https://arxiv.org/html/2605.26738#bib.bib6))。因此,为了评估改进的语用理解或“察言观色”能力,我们使用对话系统中的幽默识别基准 ColBERT 幽默基准 (Annamoradnejad and Zoghi 2024 (https://arxiv.org/html/2605.26738#bib.bib1)) 来评估对齐对幽默的影响,该基准衡量模型在对话设置中识别和生成语境适当幽默的能力。
相似文章
KARMA: 基于知识图谱的自动化推理实现与对齐
KARMA 提出了一种基于知识图谱的方法来生成槽位对齐的对比候选项,并使用槽位并行对齐(SPA)在实体槽位级别应用偏好优化,解决了LLM推理监督中的粒度不匹配问题。
可配置奖励模型用于平衡安全对齐
本文介绍了一种可配置安全奖励模型(CSRM),该奖励模型可根据需求配置,以适应大语言模型对齐中异构且不断变化的安全要求。CSRM在可配置安全基准上取得了最先进的结果,并改善了有用性与安全性之间的权衡。
元认知作为奖励:通过知识与调控信号强化大语言模型推理
介绍了元认知即奖励(MaR),一个基于元认知知识与调控信号指导大语言模型推理的强化学习框架,在推理基准上相比基准方法最高提升11%。
通过强化学习改进LLM生成的流程模型质量:奖励函数设计的作用
本文系统研究了用于强化学习的奖励函数设计,以提升LLM生成的BPMN流程模型质量,发现等权重奖励优于目标加权奖励,且设计选择与模型架构以非平凡的方式相互影响。
@akshay_pachaar: Karpathy关于强化学习的预测正在成真!他指出奖励函数不可靠,并认为单一的奖励…
Karpathy对强化学习中奖励函数的批评被OpenPipe的ART框架通过RULER解决,该框架允许使用自然语言定义奖励并由LLM评估,取代了手动奖励工程。