面向公平强化学习的推理时策略对齐

arXiv cs.LG 论文

摘要

本文提出了一种推理时策略塑形框架,受大语言模型推理时对齐的启发,无需重新训练即可将预训练的强化学习策略引导至基于福利的公平目标。

arXiv:2608.00175v1 公告类型:新 摘要:深度强化学习(RL)智能体通过优化标量奖励函数实现了强大的性能。然而,一旦部署,这些RL智能体的策略往往是僵化的,并且难以适应新的性能标准。例如,为最大化期望累积奖励而训练的智能体可能无法容纳先前未知的利益相关者偏好。现有的在RL中实现公平性(一种偏好类型)的方法通常假设这类偏好是事先已知的,并且需要在面向公平性的度量下对策略进行完全重新训练。受大语言模型中推理时对齐的启发,我们研究了在不更新基础策略参数的情况下,在推理时将预训练的RL策略引导至基于福利的公平目标的问题。我们将推理时公平对齐形式化为一个策略塑形问题,并提出了一种乘法策略塑形框架,该框架使用与动作相关的福利分数来调整动作概率,从而无需对基础策略进行修改。我们的框架具有通用性,兼容任意深度RL智能体。通过在多个领域的广泛实验,我们证明了推理时策略塑形能够显著改善基于福利的公平目标,同时保持核心任务性能。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:37

# 面向公平强化学习的推理时策略对齐 来源:https://arxiv.org/html/2608.00175 ###### 摘要 深度强化学习(RL)智能体通过优化标量奖励函数获得了强大的性能。然而,一旦部署,这些RL智能体的策略往往是僵化的,并且适应新的性能标准的成本很高。例如,为最大化期望累积奖励而训练的智能体,可能无法适应先前未知的利益相关者偏好。现有的在强化学习中实现公平性(一种偏好类型)的方法,通常假设这些偏好是先验已知的,并且需要在面向公平的度量下对策略进行完整的重新训练。受大语言模型中推理时对齐的启发,我们研究了在推理时将预训练的RL策略引导至基于福利的公平目标,同时不更新基础策略参数的问题。我们将推理时公平对齐形式化为一个策略塑造问题,并提出一个乘法策略塑造框架,该框架使用依赖于行动的福利分数来调整行动概率,因此无需修改基础策略。我们的框架是通用的,并且兼容任何深度RL智能体。通过在多个领域的广泛实验,我们证明了推理时策略塑造能够显著改善基于福利的公平目标,同时保持核心任务性能。

## 1 引言

深度强化学习在从机器人技术(Peters et al.,2003 (https://arxiv.org/html/2608.00175#bib.bib41))到游戏对弈(Silver et al.,2017 (https://arxiv.org/html/2608.00175#bib.bib56))等领域展现了非凡的成功,通常通过优化单个标量奖励函数来实现(Sutton & Barto,1998 (https://arxiv.org/html/2608.00175#bib.bib59))。这些成就往往建立在固定的任务定义和精心设计的训练流程之上,其中RL智能体通过与环境的交互学习最大化回报的策略。然而,此类策略在部署时可能显得僵化且脆弱,因此,纳入新的约束、适应不断变化的利益相关者偏好,或处理分布外(OOD)偏移(Haider et al.,2023 (https://arxiv.org/html/2608.00175#bib.bib18); Ajay et al.,2022 (https://arxiv.org/html/2608.00175#bib.bib2)),通常需要代价高昂的重新训练或精细的微调,且无法保证稳健性。这在具有社会影响力的领域变得尤为棘手,因为在这些领域中,目标不仅限于累积奖励,还包括公平性、安全性和多利益相关者福利。例如,在自动驾驶和决策系统中,效率可能需要与风险敏感性和安全性进行权衡。类似地,在资源分配和交通运输中,可能要求在不同用户群体之间实现公平的结果。关键在于,此类安全或公平偏好可能会随着环境、监管变化或社会期望而演变。然而,在大多数深度RL方法中,这些需求在训练期间被处理,而适应新的偏好或新的利益相关者通常需要重新训练。在实践中,由于相关的计算成本、时间和数据需求,这种重新训练往往不可行(Mujtaba et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib37))。因此,需要一种能够在无需重新训练基础策略的情况下,将*预训练*的RL策略适应到不断演变的公平目标的技术。例如,当单一基础策略服务于具有异构公平需求的多个客户时,或者当监管变化要求在重新训练可行之前就进行合规调整时。

与已部署RL智能体的静态特性相反,大语言模型(LLMs)的最新进展表明,训练后对齐是可行的(Kumar et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib28))。这些推理时对齐技术旨在不更新参数的情况下,将冻结的预训练模型引导至新的目标。诸如奖励引导解码、表示引导和轻量级策略自适应等方法已经证明,冻结模型可以通过辅助评分或受控解码策略灵活地引导至新目标(Li et al.,2023 (https://arxiv.org/html/2608.00175#bib.bib29); Xu et al.,2024 (https://arxiv.org/html/2608.00175#bib.bib65); Lin et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib30))。其他方法,包括基于人类反馈的强化学习(RLHF)(Ouyang et al.,2022 (https://arxiv.org/html/2608.00175#bib.bib40); Kaufmann et al.,2024 (https://arxiv.org/html/2608.00175#bib.bib25))、直接偏好优化(DPO)(Rafailov et al.,2023 (https://arxiv.org/html/2608.00175#bib.bib43))和激活引导(Turner et al.,2023 (https://arxiv.org/html/2608.00175#bib.bib61)),进一步说明了如何通过偏好模型或推理时控制在部署时重塑行为。这些技术主要对自回归LLM有效,因为生成可以被视为一个具有即时反馈的短视距决策过程,并且过去的决策(生成的token)会自动保留在模型的上下文中。然而,这种方法在RL中的适用性是一个开放问题,因为诸如公平性之类的目标通常是在长视距上定义的(例如,轨迹的期望),而不是作为即时的、每步的信号。此外,标准的已部署RL策略是马尔可夫的,这意味着它们仅以当前状态为条件。与自回归生成不同,过去的行动不一定保留给策略,除非它们被编码到状态中。因此,目前尚不清楚推理时对齐是否以及如何解决顺序决策问题。本文正是针对这个问题:给定一个固定的、预训练的RL策略,我们能否在部署时将其长期行为引导至诸如公平性之类的目标,同时保持其核心性能?

参考图注

图1:推理时公平对齐的动机。左:在训练期间,策略π\pi通过标准RL优化标量回报。中:在部署时,标量奖励被揭示为结构上可分解为向量奖励r∈Rn\mathbf{r}\in\mathbb{R}^{n}。右(A):直接部署冻结策略π\pi可获得高总回报,但各目标间的分配不公平。右(B):我们的方法附加一个轻量级塑造模块(QFair),该模块在推理时使用基于累积奖励向量的福利感知Q值重新加权行动概率。这实现了公平的结果,同时保持了基础策略的总回报,无需重新训练基础策略,并且能够在部署时适应新的公平目标。

解决这一对齐问题在实践上和伦理上都很重要。从部署的角度来看,推理时对齐降低了重新训练成本,提高了适应性,并缓解了训练-部署不匹配问题(Mujtaba et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib37))。从社会的角度来看,在高风险系统中学习人类对齐且公平的解决方案至关重要,尤其是当这些系统影响多个最终用户时。现有的对齐且公平的RL方法,包括带标量化的多目标RL(MORL)(Siddique et al.,2020 (https://arxiv.org/html/2608.00175#bib.bib50); Hayes et al.,2022 (https://arxiv.org/html/2608.00175#bib.bib19))、约束马尔可夫决策过程(CMDPs)(Bei et al.,2022 (https://arxiv.org/html/2608.00175#bib.bib4))和奖励塑造(Ng et al.,1999 (https://arxiv.org/html/2608.00175#bib.bib39); Kumar & Yeoh,2025 (https://arxiv.org/html/2608.00175#bib.bib27)),都是在训练时运作,并将公平性直接纳入学习目标(Jabbari et al.,2017 (https://arxiv.org/html/2608.00175#bib.bib22); Weng,2019 (https://arxiv.org/html/2608.00175#bib.bib62); Siddique et al.,2023 (https://arxiv.org/html/2608.00175#bib.bib51);2024 (https://arxiv.org/html/2608.00175#bib.bib52))。虽然这些方法可以产生有效的解决方案,但它们通常假设期望的偏好是先验已知的,并且需要完全重新训练或维护一个用于不同标量化的策略组合(Busa-Fekete et al.,2017 (https://arxiv.org/html/2608.00175#bib.bib6); Zimmer et al.,2021 (https://arxiv.org/html/2608.00175#bib.bib71); Do & Usunier,2022 (https://arxiv.org/html/2608.00175#bib.bib12); Yu et al.,2023a (https://arxiv.org/html/2608.00175#bib.bib66))。诸如域随机化(Tobin et al.,2017 (https://arxiv.org/html/2608.00175#bib.bib60))之类的泛化技术可以提高鲁棒性,但它们不能实现*事后*目标对齐。与此同时,策略塑造方法(Knox & Stone,2010 (https://arxiv.org/html/2608.00175#bib.bib26); Griffith et al.,2013 (https://arxiv.org/html/2608.00175#bib.bib16))和LLM中的推理时对齐策略(Ouyang et al.,2022 (https://arxiv.org/html/2608.00175#bib.bib40); Rafailov et al.,2023 (https://arxiv.org/html/2608.00175#bib.bib43); Balashankar et al.,2024 (https://arxiv.org/html/2608.00175#bib.bib3); Xu et al.,2024 (https://arxiv.org/html/2608.00175#bib.bib65); Lin et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib30))展示了推理时的行为控制,但它们没有通过策略塑造来形式化RL中的公平对齐。迄今为止,推理时对齐在很大程度上仍然局限于自回归生成模型,而不是具有公平目标的长视距顺序控制。在本文中,我们通过提出一种基于策略塑造的RL*推理时公平对齐*方法来弥合这一差距,使冻结的基础策略能够在部署时适应公平目标,并且只需离线训练一个轻量级评论家。

我们假设可以访问一个经过训练以最大化标准标量回报的基础策略π(a∣s)\pi(a\mid s),并考虑环境反馈可以分解为多个支持公平(福利)公式的目标分量的设置。我们的目标是构建一个塑造策略π′\pi^{\prime},该策略保持基础策略的能力(即核心奖励性能),同时将其*长期*行为引导至公平性。为了实现这一点,我们引入了一种通用的乘法策略塑造机制,该机制在推理时使用依赖于行动的评论家来重新加权行动概率。我们将此评论家实例化为神经网络QφQ_{\phi},离线训练以近似公平(福利)行动价值信号。通过在多个领域的广泛实验,我们证明了这种推理时塑造可以将长期行为引导至公平目标,同时保持基础策略的性能。

我们的主要贡献总结如下:

- •我们将在深度RL中推理时公平对齐的新问题形式化为一个策略塑造问题(第4节 (https://arxiv.org/html/2608.00175#S4))。
- •我们提供了理论论证,解释了推理时基于福利的塑造何时以及为何能够在不更新基础策略参数的情况下改善公平目标(第4.3节 (https://arxiv.org/html/2608.00175#S4.SS3))。
- •我们提出了一个乘法策略塑造框架,该框架使用学习到的公平评论家在测试时进行行动重新加权,从而无需重新训练基础策略即可实现适应(第5节 (https://arxiv.org/html/2608.00175#S5))。
- •我们开发了QFair,一个依赖历史的公平QQ网络,它以奖励向量为条件,以解决优化非线性福利函数所固有的非平稳性(第5.1节 (https://arxiv.org/html/2608.00175#S5.SS1))。
- •我们提供了广泛的实证验证,表明推理时策略塑造在保持有竞争力的回报的同时显著改善了福利(第6节 (https://arxiv.org/html/2608.00175#S6))。

## 2 相关工作

##### 推理时对齐。
推理时对齐研究如何在不更新核心参数的情况下,在部署时将预训练模型引导至新目标。这一研究方向在LLM中尤为突出,其中冻结模型通过解码策略、辅助奖励模型或表示层干预进行引导(Guan et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib17); Lu et al.,2023 (https://arxiv.org/html/2608.00175#bib.bib32); Scalena et al.,2024 (https://arxiv.org/html/2608.00175#bib.bib45); Mujtaba et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib37))。受线性表示假说的启发,Sharkey等人 (2025 (https://arxiv.org/html/2608.00175#bib.bib48)) 研究了激活引导,该假说认为高层概念对应于潜在空间中的方向;引导的方式是在前向传播过程中将缩放的概念向量注入中间激活(Siddique et al.,2025b (https://arxiv.org/html/2608.00175#bib.bib55))。最近的工作进一步使用RL优化这些引导向量,表明在冻结主干的同时训练低维干预向量,可以在GSM8K和MATH等推理基准上媲美微调模型(Sinii et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib57))。补充方法包括推理时策略适配器(IPA)(Lu et al.,2023 (https://arxiv.org/html/2608.00175#bib.bib32))和诸如RLHF(Ouyang et al.,2022 (https://arxiv.org/html/2608.00175#bib.bib40))和DPO(Rafailov et al.,2023 (https://arxiv.org/html/2608.00175#bib.bib43))的奖励引导解码方法,以及如GemARM和PARM等自回归奖励建模框架(Xu et al.,2024 (https://arxiv.org/html/2608.00175#bib.bib65); Lin et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib30))。尽管取得了成功,这些方法在很大程度上局限于自回归生成,其中对齐可以被视为短视距评分。相比之下,我们将推理时对齐的范式扩展到具有轨迹级公平目标的RL。

##### 策略塑造与测试时干预。
RL中的策略塑造和测试时干预处理如何在不重新训练的情况下修改学习到的策略,通常通过外部指导或辅助评估器实现。Griffith等人 (2013 (https://arxiv.org/html/2608.00175#bib.bib16)) 的早期工作将策略塑造形式化为一种将人类反馈纳入行动选择的机制,而Ferreira & Lefevre (2015 (https://arxiv.org/html/2608.00175#bib.bib15)) 将社会信号整合到对话管理系统中,以在线优化策略。基于偏好的RL通过从成对的人类反馈中推断奖励函数,进一步解决了奖励规范错误问题(Wirth et al.,2016 (https://arxiv.org/html/2608.00175#bib.bib64); Christiano et al.,2017 (https://arxiv.org/html/2608.00175#bib.bib9))。诸如COACH(Najar & Chetouani,2021 (https://arxiv.org/html/2608.00175#bib.bib38))之类的人在环路纠正策略表明,轻量级的行动级纠正可以在不修改基础目标的情况下引导探索。更近期,Mujtaba等人 (2025 (https://arxiv.org/html/2608.00175#bib.bib37)) 明确引入了测试时策略塑造,以减轻基于文本的智能体中的不道德行为,使用分类器在部署期间惩罚不良行动。与此同时,针对LLM的token级引导方法,包括SPI(Zhang et al.,2025 (https://arxiv.org/html/2608.00175#bib.bib69))以及通过勒让德变换进行的解码时奖励组合(Shi et al.,2024 (https://arxiv.org/html/2608.00175#bib.bib49)),突显了推理时控制的更广泛适用性。

相似文章

公平强化学习

Reddit r/AI_Agents

公平强化学习引入了民主对齐,以整合来自不同代理的多个竞争性价值集,克服了传统RLHF的局限性,并通过黑盒策略包装器实现了数量级更快的优化。

优化训练策略的幻象:单调推理策略作为LLM强化学习的真正目标

Hugging Face Daily Papers

我们介绍了MIPI(单调推理策略改进)及其实例化MIPU,这是一个用于LLM的两步RL框架,通过将优化与推理策略改进明确对齐来解决训练-推理不匹配问题。在FP8量化展开下,MIPU在Qwen3-1.7B和Qwen3-4B模型上实现了改进的推理性能和训练稳定性。