通过分层推理和话语级目标奖励增强LLMs的社交智能
摘要
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
arXiv:2608.05832v1 公告类型:新
摘要:大型语言模型(LLMs)在结构化任务中表现出色,但在动态社交互动中却面临困难,因为成功需要长期目标协调和快速适应。当前方法通常对每个话语施加统一的目标导向奖励,忽略了每个对话轮次目标的特殊性,并且未能考虑潜在策略的合理性。受计划行为理论的启发,我们提出了Think-Strategy-Response(TSR)框架,将社交对话分解为两个层次阶段:高层战略规划和低层语言执行。为了优化TSR,我们引入了带有方差门控奖励的线性化分层强化学习(LHRL-VGR),这是一种新颖的算法,根据目标达成分数的方差动态路由奖励——在目标完成和策略遵循之间进行平衡。在SOTOPIA基准上的实验表明,我们的方法微调Qwen2.5-7B智能体在目标完成成功率上超过GPT-4o基线7.32%,在多智能体社交协商任务中展示了最先进的性能。
查看缓存全文
缓存时间: 2026/08/07 07:52
# 提升大语言模型在分层推理与话语级目标奖励下的社会智能 来源:https://arxiv.org/html/2608.05832 王晓峰¹ Kakam Chong 肖帅² 孔德鑫² 田青源³ 陈驹² 徐岩² 赵帅² 黄非² 王睿³ 韩曙光² 陈巨峰² ¹独立研究者 ²阿里巴巴集团 ³上海交通大学 ###### 摘要 大型语言模型(LLMs)在结构化任务中表现出色,但在动态社交互动中却面临挑战,因为成功需要长期目标协调和快速适应。现有方法通常对每句话语应用统一的目标奖励,忽视了每个对话轮次目标的特殊性,也未能考虑潜在策略背后的逻辑。受计划行为理论(Theory of Planned Behavior)的启发,我们提出了“思考-策略-回应”(Think-Strategy-Response, TSR)框架,将社交对话分解为两个层级阶段:高层战略规划和低层语言执行。为优化TSR,我们引入了线性化分层强化学习与方差门控奖励(Linearized Hierarchical Reinforcement Learning with Variance-Gated Rewards, LHRL-VGR),这是一种新颖的算法,可根据目标达成分数的方差动态路由奖励——平衡目标完成与策略遵循。在SOTOPIA基准上的实验表明,我们的方法使Qwen2.5-7B智能体在目标完成成功率上比GPT-4o基线高出7.32%,在多智能体社交谈判任务中展示了最先进的性能。¹¹代码和训练数据可在https://github.com/XFWang522/LHRL-VGR获取。 ## 1 引言 大型语言模型(LLMs)在具有明确规则和单一正确答案的静态任务上表现良好,例如数学、编程和形式逻辑(Yang et al., 2024 (https://arxiv.org/html/2608.05832#bib.bib37); DeepMind, 2024 (https://arxiv.org/html/2608.05832#bib.bib6); Jaech et al., 2024 (https://arxiv.org/html/2608.05832#bib.bib13); Guo et al., 2025 (https://arxiv.org/html/2608.05832#bib.bib9); OpenAI, 2025 (https://arxiv.org/html/2608.05832#bib.bib21))。然而,这些任务所需的推理与复杂社交互动中所需的推理截然不同——尤其是在利益冲突和追求长期目标的智能体之间的谈判场景中。通过模拟人类行为,基于LLM的智能体为训练战略性社交推理以及探索动态多智能体环境创造了新的机会(Wang et al., 2025d (https://arxiv.org/html/2608.05832#bib.bib35))。然而,LLM在这些动态社交环境中表现挣扎。要取得成功,它们需要协调长期目标并快速适应,这对它们来说仍是一个重大挑战(Zhou et al., 2024 (https://arxiv.org/html/2608.05832#bib.bib45); Zhang et al., 2024 (https://arxiv.org/html/2608.05832#bib.bib41); Liu et al., 2025a (https://arxiv.org/html/2608.05832#bib.bib19))。大量研究表明,在社交对话中,话语通常受到不同程度的认知过程支撑,并由潜在目标引导(Sperber & Wilson, 1986 (https://arxiv.org/html/2608.05832#bib.bib26); Levinson, 2019 (https://arxiv.org/html/2608.05832#bib.bib15))。目前,大多数优化方法集中在目标导向训练上。这包括端到端方法和即插即用的规划器,从回合级演变为更详细的话语级训练方法(Deng et al., 2024 (https://arxiv.org/html/2608.05832#bib.bib7); Liu et al., 2025a (https://arxiv.org/html/2608.05832#bib.bib19); Zhang et al., 2025 (https://arxiv.org/html/2608.05832#bib.bib40))。Wang等人(2025b (https://arxiv.org/html/2608.05832#bib.bib32))证明,融入多条不同的思维链可以提升性能。尽管这些方法显示出前景,但仍存在两个关键问题:(1)智能体是否真正学习了类人的社会推理,还是仅仅识别出能最大化成功的捷径话语?(2)对每句话语应用统一的目标奖励是否会忽视每个对话轮次目标的特殊性? 参见图注 图1:展示TSR框架的示例场景。本工作中的社交任务涉及一个给定场景和为双方参与者预定义的社交目标,他们通过多轮对话来最大化各自目标的达成(左侧)。 受这些问题的驱动,我们寻求一种更 principled 的方法。在计划行为理论(TPB)(Conner, 2020 (https://arxiv.org/html/2608.05832#bib.bib5))的指导下,本研究将人类社交智能的模拟细分为三个核心组成部分:**思考**受对行为的态度、感知的社会规范和控制信念所塑造(Ajzen, 1991 (https://arxiv.org/html/2608.05832#bib.bib1));**策略**是由这种认知评估形成的行为意图(Armitage & Conner, 2001 (https://arxiv.org/html/2608.05832#bib.bib3));**行动**是当意图与机会和实际行为控制相一致时表现出来的可观察行为(Webb & Sheeran, 2006 (https://arxiv.org/html/2608.05832#bib.bib36))。为使LLM智能体能够模拟这种社交行为模式,我们构建了一个两阶段生成框架,称为**思考-策略-回应**(TSR)框架。如图1 (https://arxiv.org/html/2608.05832#S1.F1)所示,该框架将社交任务分解为两个顺序阶段。这种分解直接回应了我们的第二个问题,确保每个对话轮次都受到特定高层策略的引导,从而超越了对每句话语应用统一目标奖励的做法。受分层强化学习(HRL)(Pateria et al., 2021 (https://arxiv.org/html/2608.05832#bib.bib22))中抽象原则的启发——该原则使用高层策略设定子目标,低层策略执行动作——我们将社交推理中的策略规划和语言执行映射到这种分层结构中。然而,为了适应对话的轮流性质,我们将其线性化为逐轮生成流程。因此,为了实现这一框架并解决第一个问题——确保智能体学习真正的社会推理而非捷径话语——我们引入了**带有方差门控奖励的线性化分层强化学习**(LHRL-VGR)。关键创新在于一种新的奖励结构:高层策略生成器通过一种重视前瞻性和策略连贯性的复合奖励来优化,而低层回应生成器则使用动态的方差门控奖励进行训练。这种机制智能地路由奖励,当目标达成分数稳定时优先遵循策略,当目标达成分数不确定时优先完成目标。这种方法确保回应生成不会短视地追求短期目标成功,而是受到连贯策略的约束,从而促进类人的社会推理。实验结果表明,我们的方法使TSR智能体在强基线之上取得了最先进的性能。本文的主要贡献总结如下: - •我们提出了思考-策略-回应(TSR)框架,一种线性化的分层范式,将社会推理显式分解为策略规划和语言执行,从而实现更理性且可解释的对话生成。 - •我们开发了LHRL-VGR,一种新颖的算法,引入方差门控奖励路由器,动态地为回应生成器分配目标完成或策略遵循奖励,同时通过复合策略奖励联合训练两个策略层。 - •我们的方法在SOTOPIA基准上达到了最先进的性能,使用LHRL-VGR微调的Qwen2.5-7B智能体在平均目标完成成功率上比强大的GPT-4o基线高出7.32%。 ## 2 相关工作 ##### 社会智能。 社会智能(Bandura et al., 1986 (https://arxiv.org/html/2608.05832#bib.bib4); Kihlstrom & Cantor, 2000 (https://arxiv.org/html/2608.05832#bib.bib14); Gardner, 2011 (https://arxiv.org/html/2608.05832#bib.bib8))涉及理解人类的状态、意图和行为,以及驾驭复杂的社交互动。自从像ChatGPT这样的LLM在理解人类意图方面展现出巨大潜力以来,世界各地的研究人员试图利用强化学习(RL)来增强LLM的社交能力。EPO(Liu et al., 2025b (https://arxiv.org/html/2608.05832#bib.bib20))通过强化学习技术增强了LLM的复杂和策略性推理能力。AMPO(Wang et al., 2025a (https://arxiv.org/html/2608.05832#bib.bib31))通过动态选择不同的思维模式来改进社会推理。AMPO优化了优势函数以优化思维模式切换模块。然而,EPO和AMPO都主要关注策略层面而非话语层面,这可能导致不稳定的和糟糕的用户体验。SOTOPIA-RL(Yu et al., 2025 (https://arxiv.org/html/2608.05832#bib.bib39))是一个推进LLM社会智能的RL框架。SOTOPIA-RL专注于话语级优化,并引入多维奖励来增强社交能力。然而,SOTOPIA-RL中的话语级奖励仅考虑单轮场景,未能捕捉社交目标的差异。 ##### 面向LLM的强化学习。 近期LLM的进展证明了RL在复杂任务中的有效性。CRF(Zhang & Zhao, 2025 (https://arxiv.org/html/2608.05832#bib.bib42))通过一种新颖的分层智能体架构将RL和LLM集成用于问答,解决了需要长推理场景中的幻觉问题。ReMA(Wan et al., 2025 (https://arxiv.org/html/2608.05832#bib.bib28))是一个分层多智能体RL框架,通过高层和低层推理智能体使LLM能够发展元认知能力。在社会智能领域,EPO(Liu et al., 2025b (https://arxiv.org/html/2608.05832#bib.bib20))使用专门的策略推理LLM在交互式环境中为任意LLM智能体生成实时策略。虽然EPO关注策略,但EPO缺乏对结果与策略一致性的考虑,可能导致幻觉。相比之下,我们提出了LHRL-VGR框架,旨在同时优化策略和行动。 ## 3 TSR(思考-策略-回应)生成框架 在本文中,每个社交任务由一个特定场景定义,涉及两个社交智能体,每个智能体具有不同的角色档案和私有社交目标。两个角色扮演社交智能体,记为πθ1\\pi\_\{\\theta\_\{1\}\}和πθ2\\pi\_\{\\theta\_\{2\}\},进行顺序对话交互。社交智能体在第ii轮生成的回应公式化为: aiπθj∼πθj\(⋅∣s,p,g,h1:i−1\),j∈\{1,2\},\\displaystyle a\_\{i\}^\{\\pi\_\{\\theta\_\{j\}\}\}\\sim\\pi\_\{\\theta\_\{j\}\}\(\\cdot\\mid s,p,g,h\_\{1:i\-1\}\),\\quad j\\in\\\{1,2\\\},\(1\)其中ss表示场景,pp表示当前发言智能体的人设,gg表示其私有社交目标,h1:i−1=\{a1,a2,a3,...,ai−1\}h\_\{1:i\-1\}=\\\{a\_\{1\},a\_\{2\},a\_\{3\},\\dots,a\_\{i\-1\}\\\}捕捉截至第i−1i\-1轮的交互历史。然而,这种表述并未明确考虑与长期目标对齐相关的**策略性推理过程**,从而忽略了交流中许多未在公开话语中表达的认知过程。为解决这一问题,受EPO中提出的策略性推理(Liu et al., 2025b (https://arxiv.org/html/2608.05832#bib.bib20))和计划行为理论(TPB)(Conner, 2020 (https://arxiv.org/html/2608.05832#bib.bib5))的启发,我们提出了一个两阶段流水线,如图1 (https://arxiv.org/html/2608.05832#S1.F1)最右侧列所示。在第一阶段,为了更好地模拟人类推理过程,我们使用提示工程引导策略模型πstrategy\\pi\_\{\\text\{strategy\}\}模拟类人**思考**——包括推测、推断、分析和总结——这构成决策的认知基础(态度、感知的社会规范和控制的信念)。在此思考阶段之后,生成一个**策略**(行为意图)。该策略为后续回应提供**高层指导**,将认知评估转化为可操作的计划,并增强上下文连贯性。基于人类决策天然包含结果预期这一原则(Rangel et al., 2008 (https://arxiv.org/html/2608.05832#bib.bib23)),策略生成还整合了行动的**预期目标**,以反映当前的运营目标。在第二阶段,提示指导行动模型πresponse\\pi\_\{\\text\{response\}\}根据第一阶段的策略生成**回应**。近期研究表明,过多的推理内容可能损害性能。由于我们的策略已经是先前推理的高度精炼产物,第二阶段输入中不包含第一阶段的思考内容,也不引入任何额外的推理过程。这种设计提高了输出信息的有效利用,减少了计算开销,并符合人类社交推理的层级特性。因此,在第i轮,我们的框架遵循以下输出流水线: ti,si∼πstrategy\(⋅∣sstrategy,p,g,h1:i−1\),\\displaystyle t\_\{i\},s\_\{i\}\\sim\\pi\_\{\\text\{strategy\}\}\(\\cdot\\mid s\_\{\\text\{strategy\}\},\\,p,\\,g,\\,h\_\{1:i\-1\}\),\(2\)ai∼πresponse\(⋅∣sresponse,p,si,g,h1:i−1\)\.\\displaystyle a\_\{i\}\\sim\\pi\_\{\\text\{response\}\}\\\!\\left\(\\cdot\\mid s\_\{\\text\{response\}\},\\,p,\\,s\_\{i\},g,\\,h\_\{1:i\-1\}\\right\)\.\(3\)其中sstrategys\_\{\\text\{strategy\}\}和sresponses\_\{\\text\{response\}\}分别表示两个阶段的提示内容;详见附录J.1 (https://arxiv.org/html/2608.05832#A10.SS1)。这种两阶段分解使模型能够专注于生成的特定组件,也有助于进行针对策略的监督,以及设计更灵活的、以模式为条件的行动奖励。TSR生成的一些示例可在附录I (https://arxiv.org/html/2608.05832#A9)中找到。为降低计算开销并简化下游训练,本工作中的两个阶段均使用相同的策略模型。 ## 4 LHRL-VGR 参见图注 图2:LHRL-VGR的流水线。 ### 4.1 奖励设置 在我们的TSR框架的强化学习过程中,智能体在第一阶段由复合奖励信号引导,在第二阶段由动态奖励信号引导。接下来,我们详细解释这些奖励的表述和分配。 #### 4.1.1 回应的奖励 我们设计了两种不同的奖励函数,每种对应不同的模式(如第3节 (https://arxiv.org/html/2608.05832#S3)所定义):策略遵循奖励(社交导向)和目标完成奖励(目标导向)。 **目标完成奖励**\(rgoalr^\{\\text\{goal\}\}\)。回合级目标完成奖励评估回应在多大程度上改进了目标的完成情况。借鉴近期工作(Deng et al., 2024 (https://arxiv.org/html/2608.05832#bib.bib7); He et al., 2024 (https://arxiv.org/html/2608.05832#bib.bib11); Liu et al., 2025a (https://arxiv.org/html/2608.05832#bib.bib19)),我们实现了一个稳健的LLM评估器rφ\(⋅\)r\_\{\\phi\}\(\\cdot\)来评估每一轮目标完成的进展。该评估器在\[0,10\]\[0,10\]范围内打分,其中0表示没有进展,10表示完全实现目标。相似文章
从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
超越直接回答:通过启发式强化学习将教育大语言模型对齐为苏格拉底式引导者
本文提出了HeuristicEdu,一个通过监督预热和带有启发式奖励的GRPO将Qwen2.5-7B对齐为苏格拉底式导师的流程,并在新数据集SocraticEdu上进行评估,展示了改进的脚手架有效性和减少的关键词泄露。
从描述性到规范性:揭示基于LLM的智能体的社会价值对齐
本文提出了SoVA,一个使用GraphRAG将心理学理论转化为规范性指令,从而使基于LLM的智能体与人类社会价值观对齐的框架。在DAILYDILEMMAS基准上的实验表明,相比基于提示的基线方法有显著改进。
SAVOIR:基于Shapley值奖励归因的社交技巧学习框架
SAVOIR框架将合作博弈论与Shapley值应用于语言智能体训练,显著提升其社交智能,在SOTOPIA基准上刷新SOTA,并达到GPT-4o水平。
当大型语言模型发展语言:用于高效多智能体推理的符号通信
本文提出通信语言符号路由(CLSR),多个LLM智能体自主发明并演化紧凑的符号语言进行推理,相比思维链(CoT)实现3-6倍的令牌减少,同时保持准确性。