从正确性到偏好:个性化智能体强化学习框架
摘要
本文提出了一个统一的个性化智能体强化学习框架,将通用任务奖励与个性化偏好奖励解耦,引入了PARPO和PSGM用于偏好对齐的策略优化和技能检索。
arXiv:2605.23382v1 公告类型: 新
摘要: 智能体强化学习(Agentic RL)在具有明确成功信号的任务中取得了显著进展。然而,许多现实世界的智能体应用需要用户条件化的行为:相同的查询可能会因用户不同而需要不同的规划策略和工具使用决策。这种场景带来了关键挑战:通用奖励无法捕捉异质性用户偏好,观察到的行为受到从众效应的影响,而平面记忆无法支持个性化技能检索。为此,我们提出了一个统一的个性化智能体强化学习框架,将个性化嵌入到训练时优化中。其核心是\emph{个性化锚定奖励解耦策略优化}(\textbf{PARPO}),它将通用任务质量奖励与个性化偏好奖励解耦,并使用用户特定锚点在异质奖励尺度下稳定学习。我们还引入了两阶段偏好解耦奖励模型和\emph{偏好对齐技能演化图记忆}(\textbf{PSGM}),用于个性化监督和偏好对齐的技能检索。它们共同构成了偏好识别、策略优化和结构化技能积累的闭环。在ETAPP、ETAPP-Hard和SJAgent上的实验表明,我们的框架始终优于强大的记忆和RL基线。代码和数据包含在补充材料中。
查看缓存全文
缓存时间: 2026/05/25 09:01
# 从正确性到偏好:面向个性化智能体强化学习的框架
来源:https://arxiv.org/html/2605.23382
## 作者与机构
Ranxu Zhang¹, Zeyang Li¹¹¹footnotemark:¹, Jiacheng Huang², Rui Zhang², Xiaozhou Xu², Zhe Sun², Yanyong Zhang¹, Chao Wang¹
¹中国科学技术大学
²阿里巴巴集团
###### 摘要
智能体强化学习(Agentic RL)在具有明确成功信号的任务中取得了显著进展。然而,许多真实世界的智能体应用需要**用户条件化行为**:同一查询在不同用户之间可能需要不同的规划策略和工具使用决策。这一设定带来了关键挑战:通用奖励无法捕捉异质的用户偏好;观察到的行为与从众效应交织在一起;扁平的内存无法支持个性化技能检索。为此,我们提出一个统一的个性化智能体强化学习框架,将个性化嵌入训练时优化。其核心是**个性化锚点奖励解耦策略优化(Personalized Anchor Reward-Decoupled Policy Optimization, PARPO)**,该方法将通用任务质量奖励与个性化偏好奖励解耦,并使用用户特定锚点来稳定异构奖励尺度下的学习。我们进一步引入一个两阶段偏好解耦奖励模型和**偏好对齐技能演化图内存(Preference-Aligned Skill Evolution Graph Memory, PSGM)**,用于个性化监督和偏好对齐的技能检索。这些组件共同形成偏好识别、策略优化和结构化技能积累的闭环。在ETAPP、ETAPP-Hard和SJAgent上的实验表明,我们的框架持续优于强大的内存和RL基线。代码和数据包含在补充材料中。
## 1 引言
基于大语言模型(LLM)的智能体强化学习(Agentic RL)已成为优化LLM智能体的强大范式,在代码生成(Gehring et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib1); Le et al., 2022 (https://arxiv.org/html/2605.23382#bib.bib2); Yang et al., 2024 (https://arxiv.org/html/2605.23382#bib.bib3))、网页导航(Nakano et al., 2021 (https://arxiv.org/html/2605.23382#bib.bib4); Qi et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib5))、工具使用(Qian et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib42); Feng et al., 2026a (https://arxiv.org/html/2605.23382#bib.bib7); Xia et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib45))和长周期规划(Tang et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib10); Peng et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib9); Xi et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib8))等任务上取得了强劲性能。然而,大部分进展集中在**可验证**设定(Qian et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib42); Jin et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib15); Shao et al., 2024 (https://arxiv.org/html/2605.23382#bib.bib37))下,策略优化可依赖唯一的真实答案。相比之下,在众多真实世界智能体应用中——如电商助手、旅行规划和日常日程安排(Skarlinski et al., 2024 (https://arxiv.org/html/2605.23382#bib.bib11); Schmidgall et al., 2024 (https://arxiv.org/html/2605.23382#bib.bib12); Ning et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib14); Xie et al., 2024 (https://arxiv.org/html/2605.23382#bib.bib13); Lyu et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib46))——这种可验证性失效,因为最优行为是用户依赖的:同一查询可能存在多条合理轨迹,而偏好轨迹由用户的偏好、习惯和约束决定。
近期工作已开始将LLM优化扩展到严格可验证任务之外。不可验证或开放式优化方法使用基于LLM的评估(Ye et al., 2025a (https://arxiv.org/html/2605.23382#bib.bib19); Chan et al., 2024 (https://arxiv.org/html/2605.23382#bib.bib18); Liu et al., 2023 (https://arxiv.org/html/2605.23382#bib.bib17); Zheng et al., 2023 (https://arxiv.org/html/2605.23382#bib.bib16))、基于量规的奖励(Gunjan et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib20); Liu et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib21))以及其他奖励构建方案(Ou et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib22); Ye et al., 2025b (https://arxiv.org/html/2605.23382#bib.bib23); Tan et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib25); Xu et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib24)),在无法获得精确答案时提供监督。然而,这些方法通常优化通用目标,如整体质量、有用性或量规满足度,而非用户条件化偏好。
与此同时,个性化智能体方法通过用户画像、提示策略、智能体设计和历史交互上的内存检索来融入个性化(Zhang et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib26); Liang et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib28); Cai et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib27); Wang et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib30); Lyu et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib46); Su et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib31))。虽然这些方法在提升用户对齐方面有效,但主要是在推理时个性化行为,并未直接针对用户条件化轨迹优化策略。因此,现有方法缺乏一种天然的**训练时**优化框架来实现个性化智能体行为。
个性化从根本上改变了智能体强化学习的优化目标。对于同一查询,不同用户可能偏好不同的规划策略和工具使用决策;例如,“规划东京一日游”对一位用户可能意味着以博物馆为中心的路线,而对另一位用户则是动漫主题路线。因此,智能体必须超越学习单一的**平均最优策略**,转而学习**用户条件化的工具使用轨迹**。如图1所示,这一设定引入了三个核心挑战。
- **(C1)个性化奖励模糊性**:通用奖励主要捕捉正确性、任务完成度或整体有用性,但无法表达特定用户如何评价同一轨迹,也无法处理不同用户间奖励尺度的异质性。
- **(C2)个性化偏好解耦**:观察到的用户行为往往由内在兴趣和外部从众或情境效应共同塑造,使得个性化偏好信号充满噪声,难以准确识别。
- **(C3)用户感知的内存与技能组织**:现有智能体内存通常是扁平的、以查询为中心的,无法显式建模或检索用户、意图、技能、工具、场景和轨迹之间的结构化关系。
为弥补这一差距,我们提出一个统一的个性化智能体强化学习框架,将个性化嵌入训练时优化循环中。其核心是**个性化锚点奖励解耦策略优化(PARPO)**,该方法将通用任务质量奖励与个性化偏好奖励解耦,并使用用户特定锚点来稳定异构奖励尺度下的学习。PARPO在保持通用任务能力的同时,实现用户条件化的策略改进。为提供更干净的个性化监督,我们开发了一个两阶段偏好解耦奖励模型,将内在兴趣与从众效应和情境效应分离。为支撑个性化 rollout 上下文,我们引入**偏好对齐技能演化图内存(PSGM)**,这是一个演进的异构图表内存,组织用户、技能、工具、场景和轨迹,用于偏好对齐的技能检索。这些组件共同形成偏好识别、个性化策略优化和结构化技能积累的闭环。
我们的贡献总结如下:
* • 我们为**用户条件化**智能体任务形式化了**个性化智能体强化学习**,其中最优行为依赖于个体偏好。
* • 我们提出 **PARPO**,一种基于锚点稳定和奖励解耦的策略优化方法,用于在异构用户奖励尺度下学习个性化策略。
* • 我们引入**偏好解耦奖励模型**和 **PSGM**,以提供可靠的个性化监督和偏好对齐的技能检索。
* • 我们在 ETAPP(Hao et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib29))、ETAPP-Hard 和 SJAgent(来自中国大型电商平台的真实工业智能体训练场景)上评估了我们的框架,在保持事实和逻辑质量的同时,在个性化和过程质量上取得了提升。

## 2 相关工作
### 可验证设定下的智能体强化学习
强化学习在可验证任务上已被证明能有效改进LLM智能体,包括Retool、ToolRL、AutoWebGLM 和 Search-R1(Feng et al., 2026a (https://arxiv.org/html/2605.23382#bib.bib7); Qian et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib42); Jin et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib15); Lai et al., 2024 (https://arxiv.org/html/2605.23382#bib.bib6))。基于GRPO的方法,如GRPO、DAPO、GSPO、GiGPO 和 GDPO,提升了可扩展性、序列级优化和多奖励稳定性(Shao et al., 2024 (https://arxiv.org/html/2605.23382#bib.bib37); Yu et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib38); Zheng et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib39); Feng et al., 2026b (https://arxiv.org/html/2605.23382#bib.bib41); Liu et al., 2026b (https://arxiv.org/html/2605.23382#bib.bib40))。然而,这些进展仍围绕可验证设定,以正确性或任务成功信号为中心,而非用户特定对齐(Jin et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib15); Xia et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib45); Feng et al., 2026b (https://arxiv.org/html/2605.23382#bib.bib41))。
### 不可验证与开放式优化
强化学习也已扩展到可验证任务之外,使用基于LLM的评估、量规监督和学习型奖励,例如OpenRubrics和Rubrics as Rewards(Liu et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib21); Gunjan et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib20))。虽然这些方法支持开放式输出,但它们仍然优化通用目标,如质量、量规满足度,而非个性化行为。
### 个性化、偏好与内存
先前工作通过用户画像、内存和个性化智能体探索个性化,包括PersonaAgent、O-Mem、偏好感知内存更新以及从人类反馈中学习个性化智能体(Zhang et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib26); Wang et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib30); Sun et al., 2025 (https://arxiv.org/html/2605.23382#bib.bib47); Liang et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib28))。CoPD研究了用户行为中真实兴趣与从众效应的纠缠(Zheng et al., 2021 (https://arxiv.org/html/2605.23382#bib.bib36)),而基于内存和技能的智能体检索技能和用户上下文(Zhang et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib43); Xia et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib45); Zhou et al., 2026 (https://arxiv.org/html/2605.23382#bib.bib34); Liu et al., 2026a (https://arxiv.org/html/2605.23382#bib.bib35))。大多数工作聚焦于推理时个性化,或过于强调用户条件化环境中的个性化策略。我们的工作则将训练时的用户条件化策略优化、真实偏好奖励建模和个性化技能检索统一起来。关于相关工作的更详细讨论见附录A。
## 3 问题定义
如引言所述,个性化在电商和日常规划等真实场景中至关重要,因为用户满意度不仅取决于任务是否完成,还取决于结果是否与用户偏好一致,以及整体决策体验是否令人满意。个性化智能体行为可以自然地描述为用户条件化的马尔可夫决策过程(MDP):
M = (S, A, P, Q, T, R, γ)
其中 S 表示状态空间,A 表示动作空间,P 表示用户画像空间,Q 表示用户查询空间,T : S × A → S 是转移函数,R 是奖励函数,γ 是折扣因子。对于每个实例,用户画像 p_u ∈ P 和用户查询 q ∈ Q 共同定义任务条件,初始状态 s_0 由 (p_u, q) 决定。智能体根据策略 π_θ(a_t | s_t, p_u, q) 选择动作,生成轨迹 τ = (s_0, a_0, s_1, a_1, ..., s_T, a_T)。训练目标是最小化期望轨迹奖励:
max_θ E_{(u,q)∼D, τ∼π_θ(·|p_u,q)} [R(τ, p_u, q)]
奖励由两个概念上不同的部分组成:通用质量奖励和个性化偏好奖励。通用质量奖励评估任务完成度、逻辑连贯性和过程正确性,依据的是基准特定的评估协议;而个性化偏好奖励衡量轨迹与目标用户偏好的匹配程度。因此,核心挑战在于:同一查询可能对应不同用户的不同最优轨迹。相应地,个性化智能体需要在优化通用任务质量和偏好对齐的同时,处理不同用户间个性化奖励尺度和分布的差异。
## 4 方法
为解决用户条件化任务中的个性化决策挑战,我们提出一个统一的智能体强化学习框架。如图2所示,该框架作为个性化检索、生成、评估和精炼的闭环运行。给定用户查询和画像后,框架首先从基于图的内存中检索相关历史技能,构成个性化 rollout 上下文。在此丰富上下文条件下,基于LLM的策略与环境交互,生成决策轨迹。然后,这些轨迹由双奖励系统评估:通用任务质量奖励和个性化偏好奖励。最后,策略使用这些解耦信号进行更新,高价值轨迹被整合回内存作为可复用技能。以下,我们首先介绍框架的核心——策略优化算法(PARPO,§4.1)。然后详细说明使此优化成为可能的两个支持模块:提供用户条件信号的个性化奖励模型(§4.2)和结构化 rollout 上下文的技能图内存(§4.3)。

### 4.1 PARPO:个性化锚点奖励解耦策略优化相似文章
渐进自主性作为偏好学习:智能体工具使用中信任校准的形式化
本文将智能体工具使用中的信任校准形式化为一个偏好学习问题,利用高斯过程和贝叶斯优化来决定AI代理的行为何时应自主执行或需要人类批准。
StepPO:面向智能体强化学习的步骤对齐策略优化
StepPO 引入了一种面向智能体强化学习的步骤中心范式,该范式将策略优化与智能体决策粒度对齐,在多轮交互任务中优于以令牌为中心的方法。
PAPA:在线个性化主动偏好对齐
本文介绍了个性化主动偏好对齐(PAPA),一种无需参数化奖励模型、利用实时用户反馈微调扩散模型的方法,提高了推荐和图像生成等个性化任务的效率。
LEMUR:从偏好反馈中学习与多目标强化学习对齐
本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。