从被动代理人到战略谈判者:使用 SocialRL 强化小型语言模型中的社会推理能力
摘要
本文介绍了 SocialRL,一种强化学习方法,用于增强小型语言模型中的社会推理能力,使其能够有效谈判,并在多种交互领域中匹配或超越 GPT-5 等大型模型的表现。
查看缓存全文
缓存时间: 2026/08/17 09:53
# 从被动代理人到战略谈判者:用SocialRL强化小型语言模型的社会推理能力 来源:https://arxiv.org/html/2608.13787 **黄文悦** 注:通讯作者邮箱:wenyuehua@microsoft\.com, aslic@microsoft\.com, samershi@microsoft\.com **机构**:微软研究院,AI前沿实验室 **泰勒·佩恩** **机构**:微软研究院,AI前沿实验室 **萨福拉·优素菲** **机构**:微软研究院,AI前沿实验室 **萨利玛·阿梅什里** **机构**:微软研究院,AI前沿实验室 **阿斯利·切利基尔马兹** **机构**:微软研究院,AI前沿实验室 ###### 摘要 人工智能代理日益作为用户利益的代表,代其执行安排会议、比较报价、讨价还价等任务。这类委托驱动型任务常使代理与对手(如其他用户的代理、卖家或招聘人员)处于对立面,而对方的目标可能与其委托人相冲突。然而,使助手表现友好的特质可能使其成为糟糕的代理人:一个友好且乐于助人的前沿模型可能会在无提示的情况下泄露委托人的私人信息,并在遇到阻力时轻易放弃委托人的立场。我们提出SocialRL——一个直接训练社会推理能力的通用方案,并将其应用于一个4B模型,在六个交互领域进行测试:《交易还是不交易》、CaSiNo、Craigslist、求职面试、日历和市场交易。所有领域均使用同一方案进行领域内训练,所有训练后的策略都在全部六个领域上进行评估。我们发现:(1) 领域内训练能达到前沿水平:在留出场景中,4B模型在每个领域匹配或超越了GPT-5系列,在谈判游戏中弥合了73–122%的基线至前沿的差距;这种变化在交互轨迹层面清晰可见,78%的买家开场白锚定在目标以下,而未经训练的模型仅为3%;(2) 跨领域迁移遵循游戏结构:结构配对的游戏相互促进提升,广泛的多议题捐赠游戏几乎提升所有领域,而结构孤立的游戏则无法迁移;(3) 基于此迁移结构,我们提出两种策略将各领域专家模型整合为一个统一的4B模型,该模型在所有六个环境中的平均效用达到0.627,匹配或超过了GPT-4.1(0.625)、GPT-5.1(0.619)、GPT-5.2(0.613):级联强化学习和多教师在策略蒸馏(OPD);(4) 显式心智理论(ToM)脚手架仅在训练阶段有帮助:蒸馏ToM轨迹(而非仅蒸馏动作)能提升每个环境的效用,并在各环境间实现更好的泛化;在两种ToM技能中,仅下一步动作预测能预测谈判结果。 ## 1 引言 人工智能代理不再仅仅是完成任务的工具。越来越多被要求完成的任务涉及用户的切身利益:代理代表用户行事,其结果直接影响用户利益。已部署的系统可以管理客户服务请求、协调会议、购买商品和预订资源、帮助用户比较房产或安排看房。这些应用将AI代理定位为一个**代理人**:一个被委托人信任、获授权在开放式环境中采取关键行动的系统。当代理与目标不同于其委托人的另一方交互时,委托变得尤为具有挑战性。客服代理可能面临寻求赔偿的用户,采购代理可能与希望更高价格的卖家进行谈判,日程安排代理可能需要协调存在竞争约束的参与者。在这种情境下,仅仅完成交互是不够的。一个有能力的代理人必须保护私人信息、推断对手的动机、决定何时让步或坚持立场,并追求能推进委托人利益的协议。我们将这一系列能力称为**社会推理**:为了选择具有战略有效性的行动,而对另一行为者的潜在偏好、动机和可能行为进行推理。 (图1:SocialRL概览:交互环境、基于事件的代理接口及解耦的训练基础设施。 (a) 用于委托协调和谈判的示例社会推理环境。 (b) 一个基于事件、代理无关的接口,其中有状态的环境通过观察、通知和动作的私有通道与代理通信。 (c) 解耦的训练栈,其中rollout代理连接环境和代理框架与推理和训练模块,支持可互换组件并支持强化学习和蒸馏。) 谈判长期以来一直是基于语言的战略互动的试验场,包括多物品分配、资源分配和价格议价。近期工作将这些场景扩展,以评估通用语言模型的自主性和战略行为。虽然前沿模型能够进行连贯的谈判并经常达成协议,但良好的总体结果并不能保证对委托人的忠实代表。我们发现,前沿模型在遇到有限抵抗后经常放弃争议立场。这些行为反映了对通用辅助有用的特质,如透明度、随和性以及达成共识的热切愿望,但这些特质使其在作为代理人行事时变得可预测且易被利用。这些失败反映了用于训练通用助手的目标与战略委托所需目标之间的不匹配。指令微调和基于人类反馈的强化学习通常旨在产生广泛有用、诚实、无害且遵循合作对话指令的行为。在存在目标冲突和私人信息的情境中,相同的行为先验可能表现为过早披露、过度迁就以及即使结果不利于委托人也偏好达成协议。因此,委托代理需要以委托人为条件的战略行为:选择性信息泄露、校准的保留边界,以及在达成协议会牺牲委托人效用时拒绝或延长交互的意愿。这一目标不匹配促使我们进行针对社会推理直接目标的后训练。 我们提出**SocialRL**,一个完整的用于训练和研究语言模型代理社会推理能力的基础设施与方案,如图1所示。我们专注于一个4B模型,以测试战略委托能力是否可以通过针对性的后训练引发,而非依赖于前沿规模的容量。使用SocialRL,训练得到的4B策略在某些环境中接近甚至超越了更大的GPT模型的性能,并学习到了可跨交互结构泛化的策略。我们在六个交互领域进行训练和评估:《交易还是不交易》、CaSiNo、求职面试、Craigslist,以及来自SocialReasoning-Bench的日历和市场交易。这些领域共同涵盖了单议题和多议题议价、价格谈判以及时间槽协调。为了支持这些多轮环境中的训练,我们构建了一个解耦系统,将环境、代理框架、推理引擎和训练器分离,使通用的交互基础设施能够支持强化学习、蒸馏以及异构或黑箱对手。 我们首先在每个领域内训练一个专家模型,并评估完整的跨环境迁移矩阵,然后使用级联强化学习以及多教师模式搜索OPD将这些专家整合为跨所有六个环境的单一策略。在留出场景中,我们经过领域训练的4B策略在六个环境中的表现达到了与更大的GPT模型相当的水平。跨环境迁移显著且遵循交互结构,结构相似的领域之间迁移最强。我们通过级联强化学习和多教师OPD(MOPD)整合这些专门策略,生成了一个统一的4B模型,该模型在所有六个环境中的平均效用达到0.627,与GPT-4.1的0.625、GPT-5.1的0.619、GPT-5.2的0.613相当。 最后,我们通过**推理→行动→预测**引入显式的心智理论监督。蒸馏这些推理轨迹提高了性能和跨环境泛化能力,其中下一步动作预测成为预测谈判结果最相关的心智理论技能。 ##### 贡献。 - **战略委托公式化与六环境套件。** 我们将战略委托形式化为一个社会推理后训练问题,并引入一个涵盖分配、多议题议价、价格谈判和基于偏好的协调的异构环境套件。我们在每个环境中训练领域专家,并在完整的跨环境迁移矩阵上评估每个策略。 - **代理无关环境与解耦训练基础设施。** 我们开发了SocialRL,结合了基于事件的、代理无关的环境接口与兼容OpenAI的rollout代理,解耦了环境、代理框架、推理引擎和训练器。相同的栈支持强化学习和蒸馏,并能与本地、远程、异构或黑箱对手协同工作。 - **前沿级4B策略与迁移感知的统一。** 我们证明了经过领域训练的4B策略能够达到与GPT-4.1、GPT-5.1和GPT-5.2相当的总体性能水平,并揭示了跨环境迁移具有强方向性和结构依赖性。我们利用这种迁移结构来整合专家模型:迁移感知的级联强化学习在仅60个额外优化步骤内达到了0.627的平均6环境效用,而多教师在策略蒸馏恢复了专家模型92.6%的平均优势。 - **显式的心智理论监督。** 我们引入**推理→行动→预测**监督,并证明蒸馏完整的推理轨迹在每个评估的谈判环境中都优于仅监督动作的策略,并提升了跨环境泛化能力。我们进一步发现,下一步动作预测,而非仅偏好推断,才是预测谈判结果最相关的心智理论组成部分。 ## 2 相关工作 ##### 语言模型代理。 大量关于语言模型代理的工作集中在使模型能够通过外部工具和数字接口进行推理、规划和行动。ReAct引入了基于语言的推理与环境动作的交错进行,而Toolformer则证明了语言模型可以学习何时以及如何调用外部API。后续基准测试评估了越来越真实的网络导航、桌面控制和工具介导的交互形式,包括WebArena、OSWorld和τ-bench。这些文献极大地推进了规划、工具选择、接口对齐和策略遵循方面的研究,其性能通常通过代理是否达到目标环境状态来衡量。战略互动引入了另一个维度:环境包含另一个适应性决策者,因此行动的价值不仅取决于其即时效果,还取决于它所揭示的信息以及它所引发的未来反应。 ##### 大语言模型作为委托代理。 大语言模型正越来越多地被视为在经济和社会关键情境中代表用户或组织行事的代理人。τ-bench模拟了代理在特定领域策略下处理零售和航空公司客户服务请求;ScheduleMe将多代理协调应用于个人日历管理。CalBench进一步研究了在私人信息下协调工作的日历助手,揭示了调度效率、公平性、沟通和隐私之间的权衡。在商业领域,ACES评估了代消费者检查市场和做产品选择的代理;在谈判方面,近期工作比较了多方议价中的顾问、教练和自主委托界面。这些情境要求代理在与其他用户、平台或代理交互时保留并基于委托人的偏好行事,而对方的目标可能不同。谈判是委托代理的一个特别直接的实例,因为成功同时取决于达成协议、管理私人信息以及为被代表的委托人获取价值。 ##### 为委托交互训练代理。 越来越多的研究通过战略交互训练语言代理。在谈判领域,先前工作探索了自我对弈和语言反馈、结合行为克隆的迭代自我对弈、具有可验证经济奖励的强化学习,以及将合成谈判监督训练与强化学习相结合的流程。这些方法能够引发更强的议价策略,但通常专门适用于特定的交互结构,如双边价格议价或资源分配。互补的工作扩大了交互式后训练的范围:Sotopia-π和Sotopia-RL训练通用
相似文章
通过分层推理和话语级目标奖励增强LLMs的社交智能
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
多买家市场中的策略性议价:基于可验证奖励的强化学习用于大语言模型谈判
本文提出一个框架,利用基于可验证奖励的强化学习来训练大语言模型,用于多买家市场中的策略性议价,解决并发谈判中的私有信息和剩余抽取问题。
@MSFTResearch: 小型语言模型借助SocialRL学会谈判,PazaBench V2将语音AI评估扩展到非洲语言…
微软研究院重点介绍了关于使用SocialRL进行小型语言模型谈判、PazaBench V2用于非洲语言语音评估、EvoLib帮助智能体从经验中学习、改进的A/B测试方法以及AI驱动的精准肿瘤学的新研究。
学习该学什么:面向小语言模型SFT-then-RL推理的分阶段专属数据集
本文提出了一种难度感知的SFT-then-RL框架,用于在推理任务上训练小语言模型(参数量≤3B),核心观点是数据难度应与SFT(学习新技能)和RL(巩固已有技能)各自的不同角色相匹配。作者为困难SFT样本引入了Bridge机制,并针对RL失败案例提出了Critique Fine-Tuning方法,在五个推理基准测试上均取得了一致性提升。
IB-RL:面向策略性对话智能体的隔离式双边强化学习
本文提出隔离双边强化学习(IB-RL),该方法让两个对话角色通过联合采样轨迹共同演化,同时各自独立优化自身奖励。该方法解决了策略性对话中强化学习的静态对手不匹配问题,并在 Vehicle TeleSales 和 Deal-or-No-Deal 基准上展现了对未见对手更强的泛化能力。