情感计算中关系范式的转变:情感共振、活力情感与语音交互场
摘要
本文提出了一种情感计算的关系框架,将焦点从个体情绪状态转向语音动态中的交互场,并通过一项使用自监督语音表示来检测方向性表达耦合的实证研究加以支持。
arXiv:2609.09864v1 公告类型:新
摘要:情感计算在很大程度上遵循个体状态范式,从孤立的说话者中提取离散的情绪标签或唤醒度/效价。我们认为这种框架对于交互是不完整的。基于情感共振和活力轮廓理论,我们提出一个关系框架,其中情感分析的主要单位是语音动态中构成的交互场。作为概念验证,我们展示了一项初步实证研究,使用连续自监督语音表示来检测多方对话中的方向性表达耦合。耦合是特定于交互状态的,集中在亚秒时间尺度上,并且在排他性语音负对照下崩溃,这与情感动态的关系解释一致。我们介绍了基于Affective Resonance Dynamic Ontologies的Artificial Affective Resonance Intelligence设计框架,并通过跨交互状态的零校准方向性耦合分析加以支持。
查看缓存全文
缓存时间: 2026/09/11 08:41
# 情感计算的关系范式转向:情感共鸣、活力情感与声音交互场域 来源:https://arxiv.org/html/2609.09864 Gorman Yao ###### 摘要 情感计算长期遵循个体状态范式,从孤立说话者中提取离散情感标签或唤醒度/效价维度。我们认为这种框架对于交互而言并不完整。基于情感共鸣与活力轮廓理论,我们提出一种关系框架,其中情感分析的基本单位是声音动态所构成的交互场域。作为概念验证,我们通过初步实证研究,利用连续自监督语音表征检测多方对话中的方向性表达性耦合。耦合具有特定交互情境性,集中于亚秒时间尺度,并在独白负面控制条件下坍塌,这与情感动力学的关系解释一致。我们提出基于情感共鸣动态本体论的人工情感共鸣智能设计框架,辅以跨交互情境的零校准方向性耦合分析。 ###### 关键词 情感共鸣、活力情感、活力轮廓、声音交互场域、ARDO、AARI、情感计算、人机交互设计、生成主义、前语义情感、多方语音、格兰杰因果性、新控制论、WavLM、参与式意义建构、情感调谐、社交机器人 ††地址:1Nurobodi,澳大利亚††邮箱:info@nu robodi\.com ## 1 引言 情感计算——致力于构建能识别、建模并回应人类情感的系统——主要通过探问个体在特定交互情境下可能经历何种情感来推进。主流流程将声学、语言学、生理或生物特征信号映射到离散情感类别或连续的唤醒度/效价维度\[1 (https://arxiv.org/html/2609.09864#bib.bib1),2 (https://arxiv.org/html/2609.09864#bib.bib2)\]。该范式仍富有成效,但控制论架构、多模态感知与交互设计的最新进展,开辟了一个互补的建模焦点:将关系动力学视为情感组织的主要场域。关系场域不局限于任何单一表达模态;本文从声音动态角度审视它,作为可操作且具有理论依据的领域。正如Kappas与Gratch\[3 (https://arxiv.org/html/2609.09864#bib.bib3)\]所指出的,情感计算缺乏关于情感行为如何在关系中随时间展开的稳健模型。Mühlhoff\[4 (https://arxiv.org/html/2609.09864#bib.bib4)\]提出,情感共鸣并非个体趋向相似内部状态的结果,而是他们共同构成的交互场域的涌现属性——一种个体趋同模型无法捕捉的动态,因为该模型将情感视为人的属性而非交互的属性。声学同步研究展示了声音特征随时间趋同的现象\[5 (https://arxiv.org/html/2609.09864#bib.bib5),6 (https://arxiv.org/html/2609.09864#bib.bib6),7 (https://arxiv.org/html/2609.09864#bib.bib7)\],包括通过特定交互事件如反馈信号\[8 (https://arxiv.org/html/2609.09864#bib.bib8)\]实现,但通常将耦合操作化为说话者轨迹间特征相似性的增长,而非方向性、交互构型或场域层面的涌现。在独白条件下会坍塌的情境依赖性耦合表明,是交互结构而非个体状态,支配着表达动力学——现有框架无法检测这种模式。针对语音耦合的格兰杰因果方法相对罕见,且通常是双变量、单特征的\[9 (https://arxiv.org/html/2609.09864#bib.bib9),10 (https://arxiv.org/html/2609.09864#bib.bib10)\],据我们所知,尚无先前工作结合条件多方说话者模型与交互情境分解。对话中的情感识别将情感计算扩展至多方场景,但聚合的是个体状态推断而非建模说话者的关系动力学\[3 (https://arxiv.org/html/2609.09864#bib.bib3)\]。交互说话者间的前语义声音共振作为活力动力学的直接标志物\[11 (https://arxiv.org/html/2609.09864#bib.bib11),12 (https://arxiv.org/html/2609.09864#bib.bib12)\],其作为计算目标仍探索不足。我们提出一种面向场域级人类交互模型的关系重构,基于Mühlhoff的情感共鸣论述\[4 (https://arxiv.org/html/2609.09864#bib.bib4)\]、Stern的活力情感与轮廓理论\[11 (https://arxiv.org/html/2609.09864#bib.bib11)\](经Køppe等人\[12 (https://arxiv.org/html/2609.09864#bib.bib12)\]扩展),以及生成主义的参与式意义建构论述\[13 (https://arxiv.org/html/2609.09864#bib.bib13),14 (https://arxiv.org/html/2609.09864#bib.bib14)\]。我们为此立场奠定理论基础,通过对声音交互的方向性耦合分析进行论证,并发展设计启示——情感共鸣动态本体论与人工情感共鸣智能——面向侧重交互动力学而非个体状态推断的系统。我们的实证贡献包括:(1) 一个零校准方向性耦合框架,修正短窗口自回归检验中的规模膨胀;(2) 一种交互情境分解方法,提供语料库内实证控制;(3) 一种多方条件分析,减少群体层面混淆导致的虚假二元耦合;以及(4) 基于AMI会议语料库的结果,显示在相互共存条件下耦合集中于亚秒时间尺度,而宏观效应是初步的。本工作直接回应国际语音通信协会2026年会议主题“共同发声”,将言语视为交互协调而非个体产出。 ## 2 理论基础 ### 2.1 情感共鸣作为涌现的场域属性 Mühlhoff\[4 (https://arxiv.org/html/2609.09864#bib.bib4)\]提出,情感共鸣描述一类现象场域,其中交互动态流构成情感体验,而非在独立存在的个体间传递预存的内部状态。他识别出三个构成性公理:(1) 情感共鸣是关系中感动与被感动的动态纠缠;(2) 它主要体验为关系互动中涌现的内在力量;(3) 它是涌现性的、创造性的动态,产生自身的关系运动向量,而非在预分类情感标签定义的预成情感状态空间内运作。这反映了一种与基于趋同的范式本体论承诺的不同,后者常将同步研究中的耦合操作化为特征值的趋同\[5 (https://arxiv.org/html/2609.09864#bib.bib5),6 (https://arxiv.org/html/2609.09864#bib.bib6)\],将交互视为个体轨迹间的对齐而非具有自身组织的场域级动态。相比之下,Mühlhoff的论述赋予关系动力学本体论优先性——主体性与个体情感体验源于终生的关系存在史——而非先于交互的预成个体。因此,情感共鸣不同于模仿、同步或拟态;它不需形式一致,而是构成场域作为交互涌现属性的力量的内在连通性。理解这种时间-动态纹理,需要更精细地描述共振借以可感知的表达基础。 ### 2.2 活力情感、活力轮廓与前语义声音 Stern\[11 (https://arxiv.org/html/2609.09864#bib.bib11)\]引入活力情感作为动态的、非范畴的特质,后描述活力轮廓——涌动、消退、奔涌、爆发——作为其时间形式。Køppe、Harder与Væver\[12 (https://arxiv.org/html/2609.09864#bib.bib12)\]阐明三个核心维度:时间性、强度与形式。这些动态是超模态与跨模态的;此处我们聚焦声音作为理论与实践载体。声音学特征(如音色、共振峰、谐波比、抖动、振幅微扰)构成连续的能量基底,而韵律通过音调、重音、节奏和音高轮廓组织之。我们广义使用*韵律*一词,强调时间-情感轮廓的前语义组织,其可能由微音程与共振特征支撑。它们的连续共调制描绘了活力借以在交互中呈现的“时间感觉形状”\[11 (https://arxiv.org/html/2609.09864#bib.bib11)\]。这促使我们保留连续隐状态表征而非离散令牌。WavLM\[15 (https://arxiv.org/html/2609.09864#bib.bib15)\]、HuBERT\[16 (https://arxiv.org/html/2609.09864#bib.bib16)\]和wav2vec 2\.0\[17 (https://arxiv.org/html/2609.09864#bib.bib17)\]编码副语言与韵律信息无需任务标注,这已由SUPERB\[18 (https://arxiv.org/html/2609.09864#bib.bib18)\]及语音情感研究\[19 (https://arxiv.org/html/2609.09864#bib.bib19),20 (https://arxiv.org/html/2609.09864#bib.bib20)\]证实。连续表征保留了聚类可能抑制的时间动态:离散语音令牌倾向于以牺牲韵律相关性为代价追求音素不变性\[21 (https://arxiv.org/html/2609.09864#bib.bib21),22 (https://arxiv.org/html/2609.09864#bib.bib22),23 (https://arxiv.org/html/2609.09864#bib.bib23)\]。这至关重要,因为活力处于范畴情感的上游。情感韵律在约200毫秒诱发神经反应\[24 (https://arxiv.org/html/2609.09864#bib.bib24)\],早于300–400毫秒左右的语义处理\[25 (https://arxiv.org/html/2609.09864#bib.bib25)\]。基于范畴的韵律与情感系统\[2 (https://arxiv.org/html/2609.09864#bib.bib2),20 (https://arxiv.org/html/2609.09864#bib.bib20),26 (https://arxiv.org/html/2609.09864#bib.bib26)\]因此建模的是衍生表征,而非情感体验借以组织的力量、运动、方向性与鲜活感。在这一前语义层面进行计算访问最为关键,交互场域的时间、强度与形式调制在此直接表达。 ### 2.3 生成主义与关系主体 生成主义传统\[13 (https://arxiv.org/html/2609.09864#bib.bib13)\]将认知植根于通过具身交互带出的意义,而非内部表征。De Jaegher与Di Paolo\[14 (https://arxiv.org/html/2609.09864#bib.bib14)\]通过参与式意义建构扩展了这一观点:意义在交互本身中共构,而非由预成个体承载。关系主体在交互中涌现而非先于其存在——这一主张直接影响设计一个参与而非观察交互场域的系统的含义。 ### 2.4 ARDO与AARI:交互场域建模 这些基础促成了一个实用的设计区分。情感共鸣动态本体论(ARDO)命名了交互层面的组织,当持续的声音动态被建模为场域而非独立状态时,这种组织变得显著。遵循Mühlhoff\[4 (https://arxiv.org/html/2609.09864#bib.bib4)\],归因于人或AI的离散状态是共鸣的下游产物,而非其前提。这一承诺影响特征选择、训练目标和输出,并使ARDO成为一个检验交互动力学是否包含不可还原至个体轨迹之组织的框架。人工情感共鸣智能(AARI)命名在此框架内构建的系统:它们映射场域的活力轨迹,并生成针对其调制校准的响应,而非分类个体情感。传统的范畴或维度系统\[2 (https://arxiv.org/html/2009.09864#bib.bib2)\]对固定标签暴露置信度分数;这些作为接口虽有用,但预设了关系论述试图解释其涌现的范畴。ARDO则针对可能后来组织成可识别情感的连续张力、波动与动量;AARI是对应的架构方案。 ## 3 实证阐释 ### 3.1 基本原理 该框架预测,当相互定向的说话者构成一个交互场域时,方向性表达耦合应出现;当该条件被移除时,耦合应减弱。A层捕获同时共存;B层汇集非重叠的单一说话者活动,可能包含序列性参与\[14 (https://arxiv.org/html/2609.09864#bib.bib14)\];C层按说话者方向分离该活动。我们通过交互情境分解检验这一点,提供语料库内实证控制。本研究是概念性原理验证;完整实现细节留待后续工作。 ### 3.2 方法 数据:我们分析来自AMI会议语料库\[27 (https://arxiv.org/html/2609.09864#bib.bib27)\]的四方会议音频,使用近讲耳机通道,重采样至16 kHz,并在非重叠的60秒窗口中处理。对每个说话者应用语音活动检测,并映射至WavLM特征帧网格;有效帧跳跃由模型的时间下采样决定(16 kHz时约20毫秒),我们通过窗口长度到T映射对齐掩码以确保精确同步;此处报告的所有结果仅限AMI语料库,向其他语料库的推广留待未来工作。 特征提取:我们从WavLM-Base+\[15 (https://arxiv.org/html/2609.09864#bib.bib15)\]的12个Transformer层提取连续隐状态表征——这是一个在大规模音频上预训练的自监督语音模型。(HuggingFace API也返回一个初始嵌入状态;在我们的记法中使用hidden\_states\[1\.\.12\]表示Transformer层。)关键在于,我们不应用量化或K-means聚类,因为后者会为了音素不变性而丢弃韵律与情感信息\[21 (https://arxiv.org/html/2609.09864#bib.bib21),22 (https://arxiv.org/html/2609.09864#bib.bib22)\]。我们保留连续浮点隐状态,它们保留了跨表征层级的声音、韵律与副语言信息的密集纠缠——这是ARDO追踪活力动态所需的表征基底。我们的主要特征——表达性——是源自WavLM隐状态动态的跨层激活离散统计量,旨在捕捉超越整体强度的、逐刻丰富与复杂的声音表达。 多维度代理与能量控制:除标量能量代理外,同一表征处理过程也生成用于跨表征表达性、高层语义强度和帧间主题漂移的对齐序列。所有序列共享相同的特征-帧轴、窗口化与情境分解。一个情境连续片段是窗口内,针对所选预定二元VAD掩码保持为真的帧的最大连续序列。为检验表达性是否仅是能量代理的影子,我们在方向性检验与零校准之前,在每个情境连续片段内对其相对于能量进行残差化处理。这针对时间-动态表达
相似文章
跨语音与面部的情绪:多模态基础模型中的共享情感机制
本研究论文探讨了多模态基础模型中的情感敏感神经元,通过因果干预和跨模态分析,揭示了语音与面部情绪识别之间的共享情感机制。
无心之关怀:情感动态作为人-AI智能体协作的控制层
本综述综合了人-AI智能体协作中情感动态的计算与交互机制,提出情感线索作为信任、委托和监督的协调层,而非内部情绪。
AtmosERC: 模拟对话级情感氛围以增强对话中的情绪识别
本文介绍了AtmosERC,一个模拟对话级情感氛围以增强对话中情绪识别的模型。
AffectOmni:用于社交与艺术场景的强化学习可验证以人为中心情境情感推理
AffectOmni是一个基于GRPO训练的框架,用于多模态大型语言模型中的可验证情感推理,引入了People Focus和Temporal Order奖励,以增强以人为中心的证据选择和时间结构化推理,实验显示在7B规模基线上有所改进。
合成共振:面向成长导向的人机关系框架
本文介绍了'synthetic resonance'这一框架,用于理解有意义的人机关系而不将主观体验归因于人工智能,并呼吁进一步研究。