STRIDE-ED: 一个策略驱动的多步推理框架用于同情心对话系统
摘要
STRIDE-ED 是一个为同情心对话系统设计的策略驱动推理框架,它结合了结构化的多阶段推理、数据精化管道和两阶段训练(有监督微调 + 多目标强化学习)来改进情感理解和回复生成。该框架在开源大语言模型上的自动评指标和人工评估上都展示了一致的改进。
查看缓存全文
缓存时间: 2026/04/20 08:32
# STRIDE-ED:共情对话系统的策略驱动逐步推理框架
来源:https://arxiv.org/html/2604.07100
Hongru Ji1,Yuyin Fan1,Meng Zhao2,Xianghua Li1,Lianwei Wu3和Chao Gao1
1西北工业大学人工智能、光学与电子学院(iOPEN),中国
2河南工业大学人工智能与大数据学院,中国
3西北工业大学计算机科学学院,中国
{jihongru,fanyuyin}@mail.nwpu.edu.cn, [email protected], {li_xianghua,wlw,cgao}@nwpu.edu.cn
###### 摘要
共情对话不仅需要识别用户的情感状态,还需要在整个响应生成过程中做出策略感知、上下文敏感的决策。然而,共情策略框架的缺失、明确的任务对齐多阶段推理的缺乏,以及高质量策略感知数据的不足,根本上限制了现有方法,使其无法有效地将共情对话建模为复杂的多阶段认知和决策过程。为了解决这些挑战,我们提出STRIDE-ED,一个STRategy-grounded(策略驱动的)、Interpretable(可解释的)和DEep reasoning(深层推理)框架,通过结构化的策略条件推理来对共情对话进行建模。为支持有效学习,我们开发了一个策略感知数据精炼管道,集成了基于LLM的标注、多模型一致性加权评估和动态采样,构建高质量的与共情策略对齐的训练数据。此外,我们采用了两阶段训练范式,结合监督微调和多目标强化学习,以更好地对齐模型行为与目标情感、共情策略和响应格式。广泛实验表明STRIDE-ED在多种开源大语言模型上具有良好的泛化能力,并在自动指标和人工评估上都持续优于现有方法。
STRIDE-ED:共情对话系统的策略驱动逐步推理框架
Hongru Ji1,Yuyin Fan1,Meng Zhao2,Xianghua Li1††感谢:通信作者.,Lianwei Wu3和Chao Gao1
1西北工业大学人工智能、光学与电子学院(iOPEN),中国
2河南工业大学人工智能与大数据学院,中国
3西北工业大学计算机科学学院,中国
{jihongru,fanyuyin}@mail.nwpu.edu.cn, [email protected],{li_xianghua,wlw,cgao}@nwpu.edu.cn
## 1 介绍
参考图1:STRIDE-ED推理过程的示意图。给定用户话语,框架执行场景总结、情感识别、策略推断和策略引导的响应生成。
共情对话是人类社会互动的基石,不仅需要识别他人的情感状态,还需要制定能够传达理解、认可和适当支持的响应(Batson,2009)。从心理学角度来看,这是一个复杂的多阶段认知和决策过程(Davis,1983;Gao等,2023)。这突显了共情的战略性和上下文敏感性,使共情对话成为一项远超表面文本生成的挑战任务。
早期研究通过外部常识或情感词汇隐式增强对话模型。例如,先前的工作(Liu等,2022;Cai等,2023)将情感常识图或常识知识选择纳入神经架构,为更具情感感知的生成提供潜在线索。然而,没有显式建模推理或决策过程(Zhang等,2026c,b;Chen等,2025a;Luo等,2026;Wang等,2026),这些方法对情感理解如何影响响应生成的机制提供的洞察有限。
为了解决这种缺乏透明度的问题,最近的研究转向了大语言模型(LLMs),它通过思维链(CoT)提示能够更明确地建模中间推理过程。基于这一方向的工作,如(Hu等,2025),进一步鼓励LLMs在生成响应前生成显式的中间理由,从而增强可解释性(Zhang等,2024;Chen等,2025b)。
然而,这些基于CoT的方法存在根本限制:推理过程缺乏在严格策略框架中的基础。现有策略(Liu等,2021;Zhang等,2025)通常源自心理支持等特定领域,主要处理负面情感,仅限于低层次响应。对话中的情感通常跨越正面、负面和中立状态(Ji等,2025),但现有方法无法充分捕捉这个范围,缺乏对高阶认知策略的支持,如图1所示。因此,虽然这些现有工作在形式上是结构化的,但模型的推理步骤往往流于表面,并表现出不一致的策略连贯性。
总结而言,现有方法存在三个关键限制。
(1)共情策略覆盖不完整。先前的方法缺乏覆盖多样情感状态和高阶认知的综合策略体系,限制了原则性决策制定。
(2)缺乏任务对齐的多阶段推理。基于CoT的方法不会显式建模对话作为任务特定的多阶段推理过程。
(3)策略感知的监督不足。训练数据缺乏与共情策略和推理对齐的高质量标注。
为解决这些问题,我们提出STRIDE-ED,一个通过首先建立综合策略体系,然后通过专用数据管道实现任务对齐推理的框架。其核心是构建一个统一的策略体系,覆盖正面、中立和负面情感,以指导响应生成。基于该体系,我们使用权威LLMs自动标注EmpatheticDialogues数据集的策略类型和理由。随后,严格的数据精炼过程采用多LLM评估和一致性加权评分及策略感知采样来精选高质量的训练子集。最后,模型通过两阶段训练范式进行优化,结合监督微调和多目标强化学习,确保与策略、情感和结构正确性的对齐。
我们的贡献可总结如下:
- 我们提出了一个可解释的共情对话框架STRIDE-ED,具有综合的共情策略体系和逐步决策制定。
- 为支持有效训练,构建了策略感知数据精炼管道,结合基于LLM的标注、多模型加权评估和动态采样,以调节策略分布和难度。
- 引入两阶段训练范式,其中监督微调建立推理,强化学习随后改进情感对齐、策略执行和响应一致性。
- 广泛实验表明我们的框架在多种开源LLMs上具有良好泛化能力,在自动和人工评估上都实现了优异性能。
## 2 相关工作
### 2.1 隐式知识驱动的共情
早期的共情对话模型缺乏充分的先验知识,限制了它们对用户情感和背景的理解。为解决这一问题,一些研究纳入外部知识以拓展模型的视角(Zhang等,2026a)并增强推理。例如,Ghosal等(2020)利用来自ATOMIC的结构化常识知识(Sap等,2019),如心理状态和因果关系,来建模交互者互动以改进情感理解。Zhong等(2021)整合了常识感知的情感潜在概念以生成情感适当的响应,而Sabouret等(2022)通过基于常识的推理推断用户的情景背景。此外,Cai等(2023)引入了自适应常识知识选择机制来精化背景认知,Qiao等(2025)构建了多跳推理图以在响应生成期间纳入外部知识。
然而,这些方法没有明确建模策略引导的决策制定。
### 2.2 显式推理与CoT用于共情
LLMs拥有广泛的知识储备,思维链提示(Wei等,2022)使逐步推理成为可能,便于在共情对话中进行更明确的决策制定。基于这一范式,Tu等(2022)推断细粒度用户情感并采用混合策略机制进行响应生成,而Chen和Liu(2023)通过零样本提示动态生成咨询策略来指导个性化响应。后续工作进一步通过数据和结构设计增强共情:Chen等(2023)在咨询师风格的多轮对话上微调LLMs,Ye等(2025)采用策略增强的角色扮演框架,具有多个相互作用的角色来生成多样化训练数据。最后,Zhang等(2025)引入了一个意图中心的框架,将推断的支持者意图映射到支持策略,使用思维链机制。
尽管可解释性得到改进,但这些基于CoT的方法缺乏综合的策略覆盖,并且没有明确建模人类共情决策制定背后的完整、结构化推理过程。
## 3 方法论
STRIDE-ED是一个适用于多种开源LLMs的通用共情对话框架。它实现了综合的共情策略体系和任务对齐的多步CoT范式,将对话建模为渐进的认知和决策制定过程。在数据和训练层面,STRIDE-ED集成了基于LLM的自动标注、策略感知数据精炼和两阶段优化。概览如图2所示。
参考图2:STRIDE-ED框架的架构,展示了从数据准备和精炼到模型训练的完整管道。
### 3.1 任务表述
共情对话包含用户和会话代理之间的多轮交互。我们将对话历史记为C={u₁,u₂,...,uₜ₋₁},其中uᵢ表示第i轮的话语。每个话语uᵢ是标记的序列,即uᵢ=(wᵢ,₁,wᵢ,₂,...,wᵢ,ₙᵢ)。共情对话的目标是生成共情响应uₜ,同时适当识别用户的情感状态e。在这项工作中,我们引入辅助目标,并将共情对话建模为顺序生成过程。具体地,以C为条件,模型生成对话场景总结sum,推断目标情感状态e,确定共情策略stra及其执行行为acts,最后生成共情响应uₜ,对应于建模条件分布P(sum,e,stra,acts,uₜ|C)。
### 3.2 共情策略体系
在共情对话建模中,响应策略在情感理解和响应生成之间形成关键的中间阶段。有效的模型必须不是直接生成表面回复,而是根据用户的情感状态和对话背景显式决定如何响应。
Liu等(2021)提出了一个被广泛采用的八策略共情策略分类法,主要应用于侧重负面情感的咨询导向设置。然而,高阶认知策略仍未被充分探索,限制了当前系统在需要复杂推理的对话中的有效性。
受这些观察的启发,我们首先分析EmpatheticDialogues数据集中的情感分布,并对响应内容进行细粒度检查。基于这些分析,我们扩展了原始共情策略集,以更好地适应正面、中立和负面的情感背景,并为每个策略分配三级难度评级(I–III),以反映其应用所涉及的认知复杂性。特别地,原始的Question策略被进一步细分为三个不同的Exploring型策略,以捕捉更细致的认知和情感互动。
结构化策略体系指导标注和模型训练(完整细节见附录A)。
### 3.3 逐步认知CoT设计
受认知心理学见解的启发,我们将人在共情对话中的思维过程建模为逐步、渐进的思考。接收说话人的话语时,个人首先根据先验知识和背景理解推断缺失信息或对所述情况做出有根据的猜测,形成高层次的情景表示。这种情景理解使他们能够采纳说话人的视角,便于准确识别说话人的情感状态。
接下来,人们思考选择何种响应策略,由说话人的情感状态和背景线索指导。由于策略代表泛化方法,其具体执行可能在不同场景中有所不同。为了考虑这种可变性,我们引入了一个行为推断阶段,在策略选择和最终响应生成之间架起桥梁。
这种逐步CoT设计捕捉了人类共情推理中的结构化认知进展,为多阶段、策略感知的响应生成提供了原则框架。实现利用结构化的中间标签(如<scenario>、<emotion>和<strategy>)来指导模型的内部推理,最终生成响应。
### 3.4 基于LLM的自动化数据标注
基于上述理论框架,我们解决了显式标注缺失的问题。相似文章
STRIDE:面向LLM推理的可学习逐步语言反馈
STRIDE提出了一种训练框架,使用可学习的逐步语言反馈而非标量奖励来提升LLM推理能力,在多种基准测试上取得了最先进的结果。
Stratagem:通过轨迹调制博弈自博弈学习可迁移推理
# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。
PRISM:面向共情口语对话的韵律集成多智能体推理框架
PRISM 是一个多智能体框架,通过将语音感知、响应生成和语音合成解耦,并结合韵律线索与大语言模型推理及外部知识工具,以提升共情口语对话的质量。
STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation
This paper introduces STRIVE, an LLM-based framework for jointly generating and evaluating controlled event sets for psycholinguistic plausibility judgments. Experiments show that adding a global reasoning scratchpad and evaluator-guided refinement substantially improves generation quality, though near-boundary events remain challenging.
ETCHR:编辑以澄清和利用推理
ETCHR是一种新颖的图像编辑方法,它将视觉推理与图像生成解耦,采用两阶段训练过程(推理模仿和推理增强)来提升多模态语言模型在五个视觉推理任务上的性能。在Qwen3-VL-8B、Gemini-3.1-Flash-Lite和Kimi K2.5等模型上,Pass@1持续提升4-5%。