PRISM:面向共情口语对话的韵律集成多智能体推理框架
摘要
PRISM 是一个多智能体框架,通过将语音感知、响应生成和语音合成解耦,并结合韵律线索与大语言模型推理及外部知识工具,以提升共情口语对话的质量。
arXiv:2606.12902v1 公告类型:新论文
摘要:共情口语对话系统不仅需要语义恰当的回复,还需要情感一致的韵律表达。然而,级联流水线在语音转文本过程中常丢弃声学线索,而端到端语音模型则缺乏对情感和知识整合的可解释控制。为解决这些挑战,我们提出了PRISM,一个用于共情口语对话的多智能体框架,将语音感知、响应生成和语音合成解耦为协调的组件。PRISM引入了一种韵律到语言的翻译机制以稳定大语言模型推理,并支持按需调用外部知识工具生成共情对话。实验结果表明,PRISM在客观和主观指标上均实现了共情性、韵律恰当性和文本回复生成质量的一致提升。我们的代码可在以下网址获取:https://github.com/Bxzfrm/PRISM。
查看缓存全文
缓存时间: 2026/06/12 08:50
# PRISM:面向同理心口语对话的韵律整合多智能体推理框架
来源:https://arxiv.org/html/2606.12902
张洋 高峰 王镪
###### 摘要
同理心口语对话系统不仅需要语义恰当的回答,还需要与情感一致的韵律表达。然而,级联流水线在语音转文本过程中常常丢弃声学线索,而端到端语音模型则缺乏对情感和知识整合的可解释控制。为了应对这些挑战,我们提出PRISM,一个用于同理心口语对话的多智能体框架,它将语音感知、回复生成和语音合成解耦为协调的组件。PRISM引入了一种韵律到语言的翻译机制,以稳定大语言模型的推理,并能够按需调用外部知识工具以生成同理心对话。实验结果表明,PRISM在客观和主观指标上,在同理心、韵律恰当性和文本回复生成质量方面均取得了一致的改进。我们的代码可在以下地址获取:https://github.com/Bxzfrm/PRISM。
###### 关键词:
同理心口语对话,多智能体框架,韵律到语言的翻译
## 1 引言
近年来,大语言模型(LLMs)和语音技术的进步推动了人机对话系统从基于文本的交互向更自然的语音交互发展。与文本对话相比,语音对话不仅传达语言内容,还传达韵律和情感线索[eyben2015geneva,chi2025role]。这些副语言信号在同理心理解和情感回应中扮演着关键角色[zhou2018emotional,schuller2018speech],特别是在用户情感状态动态演变的情感支持场景中[wang-etal-2025-annaagent]。然而,如何有效地感知、建模和利用韵律信息仍然充满挑战。现有研究[huang2024audiogpt,serdyuk2018towards]可分为基于级联的口语对话系统和端到端语音模型。
传统的口语对话系统通常采用“ASR-文本对话模型-TTS”的级联范式[ji2024wavchat]。虽然相对成熟,但一旦语音被转录为文本,与情感和表现力相关的韵律信息就不可避免地丢失了。尽管系统可能生成语义恰当的回答,但往往无法在语音层面表现出真实的同理心[eyben2010opensmile]。此外,情感意图与语音合成之间缺乏一致性约束,使得同理心在很大程度上局限于文本领域。最近,出现了端到端语音模型,旨在直接建模从语音到语音或从语音到多模态输出的映射[borsos2022audiolm,speechgpt,chen2025valle,Rubenstein2023AudioPaLMAL]。虽然这些方法表现出强大的表示能力和高生成自然度,但它们通常将韵律和情感视为隐式特征,缺乏可解释的中间表示。此外,这类模型通常依赖于大规模联合训练,使得整合新知识或情感策略不够灵活。
知识增强提高了对话系统的事实准确性和上下文适应性[lewis2020rag],LLMs可以通过工具调用动态获取外部信息而无需额外训练[Yao2022ReActSR]。然而,先前的工作集中于基于文本的设置。同理心口语对话需要跨模态联合建模韵律感知、情感推理、知识增强和语音生成。传统的流水线常常因严格顺序处理而导致不可逆的信息丢失和累积误差。相比之下,工具调用的多智能体范式能够通过结构化的中间表示实现反馈驱动的协调和自适应工具使用,从而允许情感意图和上下文知识从感知传播到生成。
为了解决这些挑战,我们提出了PRISM(通过多智能体框架的韵律感知推理集成系统),它将语音感知、对话管理、回复生成和语音化解耦为专门的智能体。为了促进对韵律信号的稳定情感推理,该框架引入了一种韵律到语言的翻译机制,将声学线索转换为可解释的文本表示。PRISM支持在对话过程中按需调用外部知识工具,允许通过修改外部工具来即插即用更新知识源,而无需重新训练底层模型。总之,我们的贡献如下:
- •我们提出了PRISM,一个具有反馈驱动协调的多智能体框架,能够实现韵律感知的对话推理和灵活的知识整合,用于同理心口语对话。
- •我们引入了一种韵律到语言的翻译机制,将声学和时间线索映射为可解释的自然语言描述,使LLM能够以更稳定且更符合人类的方式推理用户状态。
- •我们在AvaMERG数据集上进行了大量实验,观察到PRISM在自动评估、人工评估和基于LLM的评估中始终优于基线模型。消融研究进一步验证了每个提出组件的有效性。
参见图注图1:PRISM框架概览。
## 2 方法
我们提出了一个韵律感知的多智能体同理心口语对话框架,由四个组件组成:感知器(Perceiver)、管理器(Manager)、响应器(Responder)和发声器(Vocalizer),如图1(https://arxiv.org/html/2606.12902#S1.F1)所示。
### 2.1 感知器
对于给定的输入语音\(x\),感知器输出一个结构化状态\(s=\{T,\mathbf{a}\}\),其中\(T\)是转录文本,\(\mathbf{a}\)代表一组副语言属性,旨在捕捉说话者的情感和表达状态。副语言属性\(\mathbf{a}\)包括四类线索:(i)情感线索,包括识别出的情感类别及其置信度;(ii)时间动态,包括语速和停顿比例;(iii)声学强度,以能量统计为特征;(iv)与不流畅相关的线索,包括填充词率和可解释的表达确定性得分。
我们采用OpenAI Whisper[radford2023whisper]将原始语音波形转换为文本。使用FunASR的emotion2vec[ma-etal-2024-emotion2vec]进行话语级情感分类,这是一个在多领域情感语料库上微调的自监督语音情感识别器。模型输出:
- •情感标签\(y\in\{\text{angry},\text{disgusted},\text{fearful},\text{happy},\text{neutral},\text{other},\text{sad},\text{surprised},\text{melodious},\text{unknown}\}\)。
- •置信度\(q_y\):top-1类别的softmax概率。
为了捕捉时间性说话行为,我们将音频重采样至16 kHz,并使用WebRTC语音活动检测器(VAD)估计语音和静音持续时间。停顿比例\(p\)计算为静音持续时间占总话语持续时间的比例。语速定义为转录令牌数与估计语音持续时间之间的比值,
\[
r = \frac{N_{\text{tok}}(T)}{t_{\text{sp}}},
\quad(1)
\]
其中\(N_{\text{tok}}(T)\)表示转录中的令牌数,\(t_{\text{sp}}\)表示语音持续时间。为了表征声学强度,我们计算话语的帧级RMS能量,并用均值和标准差(记为\(\mu_E, \sigma_E\))进行概括。这些统计量提供了说话者整体响度和能量变化的紧凑表示。不流畅和犹豫通过填充词率量化,定义为:
\[
f = \frac{N_f}{\max\left(N_{\text{tok}}(T), 1\right)},
\quad(2)
\]
其中\(N_f\)表示在转录中检测到的预定义填充表达式的数量。此外,为了量化说话者的确定性,我们基于语速、停顿行为和流畅度推导出启发式确定性得分\(c \in [0,1]\)。具体来说,我们首先将语速\(r\)、停顿比例\(p\)和填充词率\(f\)归一化为:
\[
\begin{aligned}
\tilde{r} &= \mathrm{clip}\left(\frac{r-2}{4},0,1\right), \\
\tilde{p} &= \mathrm{clip}(p,0,1), \\
\tilde{f} &= \mathrm{clip}\left(\frac{f}{0.2},0,1\right).
\end{aligned}
\quad(3-5)
\]
其中\(\mathrm{clip}(x,0,1)\)将\(x\)约束到区间\([0,1]\)。确定性得分随后计算为加权组合:
\[
c = \mathrm{clip}\left(0.55\,\tilde{r} + 0.25\,(1-\tilde{p}) + 0.20\,(1-\tilde{f}), 0, 1\right).
\quad(6)
\]
感知器将原始语音转换为结构化的副语言状态,可用于下游对话和同理心回复生成。
### 2.2 管理器
管理器充当中央协调模块,负责控制对话流程。其作用体现在以下两个方面。
韵律到语言的翻译。给定感知器生成的结构化副语言属性,管理器将数值和分类的韵律线索转换为简洁的自然语言描述\(D\)。该过程分为两个阶段。首先,通过基于规则的阈值化将数值属性映射为描述性的文本标签,从而产生稳定且可解释的中间表示。其次,在少样本提示策略下使用LLM生成连贯且自然的韵律描述。提示模板[wang2024langgptrethinkingstructuredreusable]包括精心设计的示例,说明情感强度、节奏、停顿行为、语音能量和确定性等因素如何共同影响自然韵律表达。通过将副语言信息转换为语言级别的描述,管理器使响应器能够以更接近人类理解的方式感知用户的表达状态,而无需直接处理低层次的声学数值特征。
回复级别的验证。为了增强生成稳定性和表达一致性,我们在管理器内引入了一个轻量级的对齐检查模块,对响应器的输出进行事后验证。该模块评估回复在情感类别、表达强度和交互策略方面是否与用户的韵律描述一致。当检测到不一致时,它会提供最小的修订建议,以指导响应器的优化。
### 2.3 响应器
响应器负责在对话级别生成最终的同理心回复,并在必要时整合外部知识。与将工具调用和文本生成为独立阶段的级联方法不同,我们采用统一的语言模型,同时处理知识使用决策和同理心回复生成,从而减少跨模块的误差传播。
具体来说,响应器以当前转录\(T\)、管理器生成的语言韵律描述\(D\)和对话历史\(H\)作为输入。LLM首先隐式判断是否需要外部知识支持;当它发现常识或上下文丰富化会带来更合适的回复时,系统通过外部工具检索多维度的常识信息,并以文本形式注入到生成上下文中。这种设计使得知识扩展可以通过替换或更新知识接口实现,而无需重新训练模型参数。
在回复生成过程中,模型将韵律描述作为显式条件信号,动态调整其回复策略和情感表达。例如,当韵律描述显示用户犹豫或低情感价值时,模型倾向于生成更安慰和支持性的回复;相反,在高唤醒情感场景中,它相应地放大情感共鸣。除了回复文本\(R\)之外,响应器还预测目标情感类别\(e\)及其表达强度\(\lambda\),为后续的情感自适应语音合成提供控制信号。
### 2.4 发声器
发声器通过自适应韵律控制将文本回复转换为富有表现力的语音,以反映情感语境。我们采用StyleTTS2[styletts2],一个基于扩散的TTS模型,支持基于参考的语音克隆和细粒度韵律操作。
韵律参数计算。发声器通过两阶段控制过程计算语音合成参数,整合了目标同理心意图和用户的韵律线索。动态确定四个参数:音色相似度\(\alpha\)、韵律强度\(\beta\)、扩散细化步数\(d\)和表达缩放因子\(\kappa\)。
\[
(\alpha, \beta, d, \kappa) = V(e, \lambda, \mathbf{a}).
\quad(7)
\]
在第一阶段,根据响应器预测的目标情感\(e\)及其表达强度\(\lambda \in [0,1]\)初始化基值。情感强度\(\lambda\)主要通过调整\(\beta\)和\(d\)来影响韵律强度和合成保真度:高强度导致更强的韵律变化和更多的细化步骤,而低强度则产生更平坦和更中性的表达。情感类别\(e\)控制表达缩放因子\(\kappa\),从而允许不同的情感风格。在第二阶段,使用感知器输出的用户副语言属性\(\mathbf{a}\)对基参数进行自适应细化。具体来说,表达确定性、情感强度和能量相关统计等特征被用于以同理心感知的方式调节韵律实现。当用户表现出低确定性或频繁停顿时,合成器降低韵律强度\(\beta\)并减弱表达缩放因子\(\kappa\)以产生更柔和的表达;当检测到强烈的负面情绪时,\(\beta\)增加以更好地匹配所需的同理心表达程度。最后,所有参数都被裁剪到有效范围内以确保合成稳定性。
文本端韵律塑造与后处理。对于停顿频繁的用户,在标点符号后插入短暂的停顿标记,以产生更有耐心的说话节奏。对于高度积极的目标情感,调整标点以增强表现力,而对于悲伤或安慰性回复,抑制过多的感叹号以保持平静语气。最后,可选的后处理在必要时通过时间拉伸和幅度缩放进一步调整语速和输出能量。这些操作允许合成语音与用户对话节奏之间实现细粒度的对齐。
## 3 实验
表1:PRISM与其他基线模型在AvaMERG测试集上的对比结果### 3.1 数据集
TOOL-ED[tooled]是ED[ed]数据集的工具增强扩展版本,旨在研究整合外部知识的同理心对话生成。每个样本包含一个简短的对话上下文及其相应的同理心回复,所有相似文章
PRISM:用于顺序决策的感知与推理交织方法
本文介绍了 PRISM,这是一个通过动态问答流程整合视觉-语言模型和大语言模型的框架,旨在提升具身 AI 任务中的顺序决策能力。
PRISM:面向企业对话式AI的基于迭代模拟与监控的提示可靠性框架
PRISM是一个闭环框架,将提示工程视为企业对话式AI的持续可靠性问题。它自动执行测试生成、模拟、评估和修复,实现了99%的可靠性,并将编写时间从几天缩短到几分钟。
PRISM: 程序化时空推理基准
PRISM是一个大规模基准,包含10,372个人工校准的指令-代码对,用于评估程序化视频生成,并采用了一个漏斗式框架,包含四个指标。对七个大型语言模型的评估揭示了代码可执行性与空间一致性之间存在显著差距。
PRISM:通过结构化多模态数据合成实现优先级感知的规则内化
本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。
PRISM:探究大语言模型幻觉中的推理、指令与源记忆
研究人员提出了 PRISM 诊断基准,该基准将大语言模型(LLM)的幻觉拆解为四个维度(知识缺失/错误、推理错误、指令遵循错误),涵盖三个生成阶段(记忆、指令、推理),并通过评估 24 款大语言模型,揭示了各类缓解策略之间存在的权衡关系。