SocialRL:通过多轮强化学习和奖励设计提升大语言模型的社会智能
摘要
本文介绍了SocialRL,一个多轮强化学习框架,通过延迟奖励传播和细粒度过程奖励增强大语言模型的社会智能,显著改善了对话系统的目标完成度。
arXiv:2609.09764v1 公告类型:新
摘要:社会智能使智能体能够读取社交上下文、推断意图并在持续对话中进行调整。随着语言模型成为自主协作者,它对于构建有效且可信的人机交互至关重要。现有的强化学习方法优化单轮话语和稀疏的结果奖励,产生短视的策略,难以管理多轮交互中的目标-关系张力。我们提出SocialRL,一个多轮强化学习框架,解决这两个挑战。首先,我们应用使用PPO的多轮强化学习,将延迟的结果奖励传播回每一轮,实现长期规划。其次,我们设计六个过程奖励维度,捕捉目标-关系的权衡,包括目标推进、关系协调、上下文连贯性等。奖励模型动态生成每个维度的细粒度评分标准,而阶段感知的权重调度在早期轮次优先考虑关系建立,中期优先目标推进,后期平衡收尾。在多个社会对话基准测试中,SocialRL将目标达成平均提高了9.2个百分点,优于相应的Base模型。这些结果证明了SocialRL在合成和真实社交场景以及标准和具有挑战性的社交场景中的有效性。
查看缓存全文
缓存时间: 2026/09/10 08:14
# SocialRL:通过多轮强化学习与奖励设计提升大语言模型的社交智能
来源:https://arxiv.org/html/2609.09764
王新涛
单位:复旦大学
陈爱丽
单位:复旦大学
施洁
单位:复旦大学
郭鸿程
单位:复旦大学
高俊、赵文轩、郎成坤、郭元力、肖仰华††thanks:通讯作者。
单位:复旦大学
单位:Hello Group
###### 摘要
社交智能使智能体能够解读社交情境、推断意图并在持续对话中灵活调整。随着语言模型成为自主协作者,社交智能成为构建有效且可信人机交互的核心。现有强化学习方法仅优化单轮话语和稀疏结果奖励,导致策略短视,难以在多轮交互中平衡目标与关系的张力。我们提出SocialRL,一个多轮强化学习框架以应对上述挑战。首先,我们应用基于PPO的多轮强化学习,将延迟的结果奖励回传至每一轮,实现长期规划。其次,我们设计了六个过程奖励维度,涵盖目标推进、关系协调、上下文连贯性等,捕捉目标-关系权衡。奖励模型动态生成每个维度的细粒度评分标准,而阶段感知权重调度在早期侧重关系建立,中期强调目标推进,后期平衡收尾。在多个社交对话基准测试中,SocialRL相比基础模型平均将目标达成率提升了9.2个百分点。结果表明,SocialRL在合成与真实社交场景以及标准与复杂社交任务中均有效。项目代码已开源:https://github.com/wjnwjnwj/SocialRL。
## 1 引言
社交智能是理解社交动态、识别他人意图并在长期对话中调整回应的能力(Zhou et al., 2024a)。对人类而言,社交智能有助于与朋友、家人和同事建立有意义的关系,创造互信与互利(Stafford & Canary, 1991)。随着语言模型从信息系统向自主智能体演进,社交智能变得至关重要,它决定了AI能否与人类深度协作并获得信任。这一技能存在一个根本性张力:在追求自身目标的同时维护与他人的关系。
社交对话具有适合强化学习的特性(Ouyang et al., 2022)。交互按序展开,每一轮回应当前情境并影响后续进程。有意义的成果——目标达成与关系质量——仅在对话结束时呈现,提供了强化学习可利用的延迟反馈。现有方法主要分为两类:单轮强化学习方法与结果奖励训练方法。单轮强化学习方法(如Sotopia-RL)优化单次话语,但忽略了多轮对话的累积价值。结果奖励训练方法(如ArCHer)使用最终结果分数指导学习,却缺乏对每轮应如何权衡社交要素的中间监督。两者在建模多轮社交动态方面均有限:要么偏好局部流畅的回复而未优化对话级行为,要么依赖稀疏的结果反馈而无过程监督。有效学习需优化多轮对话轨迹,并将社交质量分解为轮级多维奖励,在对话推进中平衡目标进展与关系健康。
为解决这些挑战,我们提出SocialRL——一个面向多轮社交对话的多轮强化学习框架,配备多维奖励系统,包含两个核心创新:
1. **多轮轨迹优化**:将多轮对话轨迹作为优化单元,使用PPO在线训练。价值网络从轮级奖励序列估计回报,使策略能在完整对话中优化目标追求与关系维护,而非孤立回应。
2. **多维动态过程奖励**:将目标-关系权衡分解为六个过程奖励维度:目标侧的目标推进与战略定位(Locke & Latham, 1990;Kellermann, 1992;Berger, 1997),关系侧的关系协调与角色一致性(Stafford & Canary, 1991;Goffman, 1959),以及作为两者基础的上下文连贯性与轮次质量(Grice, 1975;Sacks et al., 1974)。奖励模型在每轮后根据上下文生成各维度评分标准,阶段感知权重调度则在对话不同阶段调整优先级:早期侧重关系建立,中期强调目标推进,后期平衡收尾,这基于Bales的交互过程分析(Bales, 1950)与Knapp的关系阶段模型(Knapp, 1978)等经典理论。
我们在SOTOPIA、SOTOPIA-π和AgentSense上进行了大规模实验。将[0,10]的SOTOPIA-All与SOTOPIA-Hard分数对齐至百分点单位后,SocialRL在四个基准测试中相比基础模型平均将目标达成率提升9.2个百分点。我们的主要贡献包括:(1)将多轮强化学习应用于社交对话,实现平衡目标追求与关系管理的长期规划;(2)构建了基于社交对话质量目标-关系结构的六维过程奖励系统,结合适应对话阶段优先级变化的阶段感知权重调度;(3)训练策略在SOTOPIA系列与AgentSense任务上优于对比的非商业基线,而商业参考模型在多项设置中仍为性能上限。
## 2 相关工作
社交智能要求语言智能体在推断意图、追踪交互状态、规划长期策略的同时平衡个人目标与关系管理。
#### 大语言模型的社交智能
近期基准测试在交互式社交场景中具体化了这一挑战。SOTOPIA与AgentSense覆盖了协商、共情与信息验证,ToMBench则探测心智理论能力;Lifelong-SOTOPIA将评估扩展至长期多场景关系。这些环境提供了标准化、符合人类共识的评估,但成功的智能体必须在多轮轨迹而非孤立轮次上进行推理。
除基准设计外,第二类工作通过模仿、偏好学习或奖励重设计在不进行在线价值建模的情况下提升社交行为。基于SOTOPIA-π专家轨迹的行为克隆虽流畅但受限于数据覆盖;SDPO应用片段级偏好优化,ARIA在意图空间聚合奖励,SAVOIR通过期望效用与Shapley值将多轮结果归因于话语。这些方法提供了更细的监督,但静态演示、偏好或事后归因不足以处理目标多元且重要性随阶段变化的开放式对话。
#### 大语言模型的强化学习
强化学习训练超越固定演示优化交互结果。单轮强化学习方法(如应用GRPO的Sotopia-RL)独立优化每轮话语,忽略了早期行动如何影响后续社交结果。近期方法将强化学习或价值学习扩展至更长序列:ArCHer在交互轮次上学习高层价值函数,SVPO学习数学推理的步级偏好与价值,REFUEL在多轮RLHF中回归相对未来回报,OMAR通过多智能体自对弈训练对话智能体。然而稀疏结果奖励仍导致高方差价值估计,且均未显式建模阶段依赖的目标-关系权衡。相比之下,我们联合优化完整多轮轨迹与稠密过程奖励;如表1所示,尚无先前方法同时结合这三者。
## 3 SocialRL
SocialRL通过多轮强化学习训练对话策略。我们将每次交互建模为有限视野对话MDP,使用PPO优化多轮轨迹,并通过阶段感知权重从多维社交反馈计算稠密过程奖励。图2总结了整体训练框架。
### 3.1 任务形式化
每个任务实例为三元组(S,G,C),其中S为场景,G为智能体的私人社交目标,C包含双方角色信息。我们将交互建模为有限视野MDP \(\mathcal{M}=(\mathcal{S},\mathcal{A},P,r,\gamma,\rho_0,M)\)。状态包含(S,G,C)与对话历史;动作为分组为话语的标记;P追加智能体话语与对方回复;γ为折扣因子,\(\rho_0\)为初始状态分布,M为最大轮次数。奖励在话语层面分配:轮内标记获得零奖励,完成的话语获得\(r_m \in [-R_{\max}, R_{\max}]\)。因此轨迹为\(\tau=(s_0, \mathbf{a}_0, r_1, s_1, \dots, \mathbf{a}_M, r_M, s_M)\),话语似然为\(\pi_\theta(a_m | s_{m-1}) = \prod_{t=1}^{L_m} \pi_\theta(a_t^{(m)} | s_{m-1}, a_0, \dots)\)。
(后续数学推导与定理部分因篇幅限制未完全包含于用户输入,此处保留原有术语与公式结构。)相似文章
从被动代理人到战略谈判者:使用 SocialRL 强化小型语言模型中的社会推理能力
本文介绍了 SocialRL,一种强化学习方法,用于增强小型语言模型中的社会推理能力,使其能够有效谈判,并在多种交互领域中匹配或超越 GPT-5 等大型模型的表现。
通过分层推理和话语级目标奖励增强LLMs的社交智能
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
IB-RL:面向策略性对话智能体的隔离式双边强化学习
本文提出隔离双边强化学习(IB-RL),该方法让两个对话角色通过联合采样轨迹共同演化,同时各自独立优化自身奖励。该方法解决了策略性对话中强化学习的静态对手不匹配问题,并在 Vehicle TeleSales 和 Deal-or-No-Deal 基准上展现了对未见对手更强的泛化能力。
从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
通过图灵奖励训练用户模拟器
本文介绍了一种名为Turing-RL的强化学习方法,该方法利用基于图灵测试的奖励来训练语言模型,使其在对话和论坛场景中生成与人类用户无法区分的回复,性能优于基线方法。