标签
本文提出了一种用于多轮共情对话的双循环自我进化框架,利用可验证的情感反馈来优化策略并调整训练分布。在SAGE上,它将Qwen3-8B的Overall得分从53.87提升至79.24,比均匀情感奖励强化学习高出7.23个百分点。
STRIDE-ED 是一个为同情心对话系统设计的策略驱动推理框架,它结合了结构化的多阶段推理、数据精化管道和两阶段训练(有监督微调 + 多目标强化学习)来改进情感理解和回复生成。该框架在开源大语言模型上的自动评指标和人工评估上都展示了一致的改进。