EmpaAva:一个开源的智能体3D虚拟形象共情实时聊天机器人

arXiv cs.CL 论文

摘要

本文介绍了EmpaAva,据我们所知,这是首个开源的智能体3D虚拟形象共情聊天机器人,通过三智能体LLM架构实现实时的、面对面的多模态共情,在情感理解、响应质量和视听一致性方面超越了基线系统。

arXiv:2608.04709v1 公告类型:新发布 摘要:本文提出了EmpaAva,据我们所知,这是首个开源的、基于智能体的3D虚拟形象共情聊天机器人,将共情响应生成(ERG)从纯文本交流扩展至实时的面对面交互。通过类似视频通话的界面,用户与一个3D数字人对话,该数字人从语音和可选视觉输入中读取用户情感,并以情感语音、唇形同步的面部动作和逼真的3D高斯渲染进行回复。其核心是一个LLM协调三智能体架构,其中感知、共情响应规划和具身渲染构成闭环,并配合一个响应规划层,将每条回复编译为可执行的多模态计划,使语音、表情和渲染保持一致的情感觉察。EmpaAva基于强大的开源模块,提供了将它们整合为可控、可检查的体验的智能。在自动评估和人工评估中,EmpaAva在情感理解、响应质量和视听一致性方面均超越了纯文本、2D说话人脸和多模态虚拟形象基线系统。我们开源了EmpaAva,并提供了在线实时演示。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:50

# EmpaAva:开源智能体式 3D 化身共情实时聊天机器人  
来源:https://arxiv.org/html/2608.04709  
杨杰¹,徐文浩¹,林书慧²,费浩³  
¹新加坡国立大学²清华大学³牛津大学  
e1554543@u\.nus\.edu, haofei7419@gmail\.com  

###### 摘要  
本文介绍了EmpaAva,据我们所知,这是首个开源、智能体式的3D化身共情实时聊天机器人,它将共情响应生成(ERG)从纯文本交互扩展到实时、面对面的交互。通过类似视频通话的界面,用户与一个3D数字人交谈,该数字人从语音和可选的视觉中感知用户情绪,并以情感语音、唇形同步的面部运动和逼真的3D高斯渲染进行回复。其核心在于,一个LLM协调三智能体架构(Tri-Agent Architecture),其中感知、共情响应规划和具身渲染形成闭环,并辅以响应规划层,将每个回复编译为可执行的多模态计划,使语音、表情和渲染保持同一共情意图。基于强大的开源模块,EmpaAva提供了将这些部分绑定为一个可控、可检查体验的智能。在自动化和人工评估中,EmpaAva在情感理解、响应质量和音视频一致性方面均超越了纯文本、2D说话人脸和多模态化身基线。我们开源了EmpaAva¹¹¹https://empaava.top/,并提供在线实时演示²²²https://empaava.top/demo。  
EmpaAva:开源智能体式 3D 化身共情实时聊天机器人  
杨杰¹,徐文浩¹,林书慧²,费浩³††通讯作者。  
¹新加坡国立大学²清华大学³牛津大学  
e1554543@u\.nus\.edu, haofei7419@gmail\.com  

## 1 引言  
过去几年,大语言模型(LLM;OpenAI,2022(https://arxiv.org/html/2608.04709#bib.bib16);Chung et al.,2022(https://arxiv.org/html/2608.04709#bib.bib17))已成为极其流利的对话伙伴,但仅靠流畅性并不能让机器有人情味。人类级别的交互还需要*共情*:即读懂他人感受并以安慰和支持回应的能力。这一目标推动了共情响应生成(ERG;Rashkin et al.,2019(https://arxiv.org/html/2608.04709#bib.bib1))以及一系列在回答前推断用户情绪的研究(Lin et al.,2019(https://arxiv.org/html/2608.04709#bib.bib2);Majumder et al.,2020(https://arxiv.org/html/2608.04709#bib.bib3);Li et al.,2020(https://arxiv.org/html/2608.04709#bib.bib4)),这些研究已支撑起从心理健康陪伴到情感支持对话等场景(Liu et al.,2021(https://arxiv.org/html/2608.04709#bib.bib18))。然而,人类的共情远不止言语。颤抖的声音、柔和的目光、犹豫的停顿都承载着纯文本无法传达的情感分量。因此,近期研究将ERG推向多模态环境,联合建模用户所说的内容、说话方式以及面部变化(Fei et al.,2024(https://arxiv.org/html/2608.04709#bib.bib6);Zhang et al.,2025(https://arxiv.org/html/2608.04709#bib.bib7))。与此同时,化身驱动的视频生成已大幅成熟,音频驱动的人像模型(Zhang et al.,2022(https://arxiv.org/html/2608.04709#bib.bib9);Tian et al.,2024(https://arxiv.org/html/2608.04709#bib.bib22);Xu et al.,2024c(https://arxiv.org/html/2608.04709#bib.bib23))能够合成栩栩如生的说话人脸。面对面的数字人可以说是共情最自然的载体:它让用户*看到*倾听者点头、微笑和反应,从而闭合了聊天气泡无法弥合的循环。  
参见图1说明  
图1:EmpaAva。在类似视频通话的隔间中,用户与一个3D数字人交谈,该数字人能感知用户的情绪并面对面回复,带有情感语音、唇形同步的面部运动以及逼真的3D化身渲染。  
然而,将这一愿景转化为可部署的系统远未解决,其中有两大障碍尤为突出。第一是*表达保真度*。许多共情化身的工作仍依赖2D说话人脸合成(Prajwal et al.,2020(https://arxiv.org/html/2608.04709#bib.bib8);Zhang et al.,2022(https://arxiv.org/html/2608.04709#bib.bib9)),这类方法难以应对三维一致性、自然头部运动和空间真实感。对于一个旨在视频通话中与用户面对面的系统,3D化身是更忠实的具身形态:FLAME(Li et al.,2017(https://arxiv.org/html/2608.04709#bib.bib11))提供可控的几何和表情,而3D高斯泼溅(Kerbl et al.,2023(https://arxiv.org/html/2608.04709#bib.bib12);Qian et al.,2023(https://arxiv.org/html/2608.04709#bib.bib13);Cho et al.,2024(https://arxiv.org/html/2608.04709#bib.bib24))渲染出2D流程无法企及的逼真、视角一致的人头。第二是*交互智能*。现有的3D化身方法大多能根据给定语音驱动说话人头,但未能涵盖从感知用户情绪、规划共情回复、再到通过具身面部发声的完整链路。据我们所知,目前还没有*开源、实时*的系统将这一链路封装成社区可轻松运行和扩展的形式。我们用EmpaAva填补了这一空白——据我们所知,这是首个开源、智能体式的3D化身共情实时聊天机器人。如图1(https://arxiv.org/html/2608.04709#S1.F1)所示,用户进入一个类似视频通话的隔间,与一个3D数字人交流,该数字人倾听、感知用户情绪,并通过同步的语音、面部运动和情绪一致的渲染来回应。在感知和生成方面,EmpaAva站在强大的开源巨人之肩上,例如3DGS+FLAME渲染和情感TTS引擎EmotiVoice(NetEase Youdao,2023(https://arxiv.org/html/2608.04709#bib.bib26)),因此其贡献集中在协调这些部分的智能上。这种智能被组织为一个以LLM为推理核心的智能体系统,呼应了LLM作为控制器来规划和调度专用工具的趋势(Yao et al.,2023(https://arxiv.org/html/2608.04709#bib.bib19);Shen et al.,2023(https://arxiv.org/html/2608.04709#bib.bib21);Xi et al.,2023(https://arxiv.org/html/2608.04709#bib.bib20))。两个设计承载了新颖性。*三智能体架构*将漫长的感知—决策—表达链拆分为三个协作智能体——感知智能体、响应智能体和渲染智能体,模拟人先读懂情境、再决定如何回应、最后通过声音和表情传达的过程。这种拆分不仅使每个阶段模块化且可独立升级,还将扁平流水线转变为闭环共情回路,能够在多轮对话中追踪用户的情绪状态。第二个是LLM与渲染后端之间的*响应规划层*。响应智能体不是转发一段纯文本,而是输出一个结构化的*回复计划*,明确谁来说、用哪种声音和情绪基调、在什么背景下、调用哪些模块。这个计划充当一个统一的表达意图,所有生成器都遵循它,使安慰的措辞、温和的声音和柔和的表情保持一致,并能精细控制化身微笑、点头或放慢语速的强度。总体而言,我们做出以下贡献:  
1. 1)我们提出了EmpaAva,据我们所知,这是首个开源、实时的智能体式3D化身共情聊天机器人,通过文本、语音和视觉提供面对面的共情交互。  
2. 2)我们提出了一种三智能体架构,将共情交互分解为感知、响应规划和具身渲染,形成闭环、可控且状态感知的共情回路。  
3. 3)我们引入了一个响应规划层,将LLM的回复转换为可执行的多模态表达计划,强制跨模态一致性并实现可控的化身行为。  
4. 4)我们发布了完整实现、在线实时演示和评估设置,以支持具身共情智能体的研究。  

表1:EmpaAva与具有代表性的先前工作的定位。OS:开源;LLM:基于LLM的推理核心;MM:多模态(文本+语音+视觉)输入;3D:具身3D化身输出;Emp.:共情导向;Live:交互式实时系统。  

| 系统 | 开源 | LLM | 多模态 | 3D | 共情 | 实时 |
|---|---|---|---|---|---|---|
| 文本ERG(Lin et al.,2019(https://arxiv.org/html/2608.04709#bib.bib2)) | ✓ | × | × | × | ✓ | × |
| 2D说话人脸(Zhang et al.,2022(https://arxiv.org/html/2608.04709#bib.bib9)) | ✓ | × | × | × | × | × |
| 3D化身(Qian et al.,2023(https://arxiv.org/html/2608.04709#bib.bib13)) | ✓ | × | × | ✓ | × | × |
| AvaMERG(Zhang et al.,2025(https://arxiv.org/html/2608.04709#bib.bib7)) | × | ✓ | ✓ | × | ✓ | × |
| EmpathyEar(Fei et al.,2024(https://arxiv.org/html/2608.04709#bib.bib6)) | ✓ | ✓ | ✓ | × | ✓ | ✓ |
| EmpaAva(本文) | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |

## 2 相关工作  
##### 共情对话:从文本到多模态。共情响应生成要求对话系统识别用户感受,并以安慰和支持回应。早期工作完全基于文本:EmpatheticDialogues(Rashkin et al.,2019(https://arxiv.org/html/2608.04709#bib.bib1))建立了一个广泛使用的基准,MoEL、MIME和EmpDG等模型编码用户情绪以增强共情质量和相关性(Lin et al.,2019(https://arxiv.org/html/2608.04709#bib.bib2);Majumder et al.,2020(https://arxiv.org/html/2608.04709#bib.bib3);Li et al.,2020(https://arxiv.org/html/2608.04709#bib.bib4)),情感支持对话则增加了策略引导的安慰(Liu et al.,2021(https://arxiv.org/html/2608.04709#bib.bib18))。这些方法只读写文字,却遗漏了人们用以流露真实感受的韵律、表情、语速和微表情。因此,较新的研究路线延伸到视觉和语音(Poria et al.,2019(https://arxiv.org/html/2608.04709#bib.bib5)),面向化身的系统如EmpathyEar和AvaMERG联合建模文本、语音和视觉(Fei et al.,2024(https://arxiv.org/html/2608.04709#bib.bib6);Zhang et al.,2025(https://arxiv.org/html/2608.04709#bib.bib7))。然而,它们的回复仍然以文本、语音或2D说话人脸的形式呈现,无法实现具身反馈。  
##### 说话人脸与3D化身生成。表达共情还需要合适的声音、面部运动和头部姿态,这推动了化身生成的并行研究路线。Wav2Lip和SadTalker等2D方法从语音或单张图像合成唇形同步人脸(Prajwal et al.,2020(https://arxiv.org/html/2608.04709#bib.bib8);Zhang et al.,2022(https://arxiv.org/html/2608.04709#bib.bib9)),DEEPTalk注入了情感表达动态(Kim et al.,2024(https://arxiv.org/html/2608.04709#bib.bib10)),最近的扩散式人像模型进一步推动了逼真度和头部运动(Tian et al.,2024(https://arxiv.org/html/2608.04709#bib.bib22);Xu et al.,2024c(https://arxiv.org/html/2608.04709#bib.bib23),b(https://arxiv.org/html/2608.04709#bib.bib25))。这些方法受限于2D图像平面,在三维一致性、自然头部姿态和空间真实感上仍然脆弱。3D化身技术直接应对这一问题,将FLAME(Li et al.,2017(https://arxiv.org/html/2608.04709#bib.bib11))的可控几何和表情与3D高斯泼溅(Kerbl et al.,2023(https://arxiv.org/html/2608.04709#bib.bib12))的高保真渲染相结合;GaussianAvatars、GaussianTalker、When Words Smile和A2-LLM展示了可控的音频驱动3D头部(Qian et al.,2023(https://arxiv.org/html/2608.04709#bib.bib13);Cho et al.,2024(https://arxiv.org/html/2608.04709#bib.bib24);Xu et al.,2024a(https://arxiv.org/html/2608.04709#bib.bib14);Hu et al.,2026(https://arxiv.org/html/2608.04709#bib.bib15))。但连接组织仍然缺失:这些系统根据给定语音驱动说话头部,没有一个组装出从感知用户情绪、经过共情规划、再到具身3D表达的开放、LLM驱动的闭环。EmpaAva正占据这一空间,将语音识别、语音情感识别、基于LLM的共情规划、结构化回复计划、情感语音合成、音频驱动面部运动、FLAME控制和3DGS渲染统一到一个智能体系统中(表1(https://arxiv.org/html/2608.04709#S1.T1))。  
参见图2说明  
图2:EmpaAva系统的工作流程。  
参见图3说明  
图3:EmpaAva的三智能体架构。感知智能体理解用户,响应智能体规划共情回复,渲染智能体将计划转化为具身3D化身视频。  

## 3 系统工作流程  
EmpaAva完全在浏览器中运行,作为一个类似视频通话的情感隔间。图2(https://arxiv.org/html/2608.04709#S2.F2)展示了一轮完整的交互,我们从用户视角来走一遍。  
1. ▶ 进入(步骤1-3)。访客无需登录即可访客身份加入,从弹出窗口中选择一个数字化身及其声音和背景,然后直接进入通话,化身占据主窗口,麦克风和可选摄像头随之开启。  
2. ▶ 交谈(步骤4)。交互模拟真实通话:麦克风和摄像头保持开启,语音活动检测将每段话自动切分并提交,因此无需录制、发送或停止按钮。口语语言被实时检测,并驱动识别、推理和合成,用户可以用英文或中文交流。  
3. ▶ 回应(步骤5-6)。每一轮,后端读取用户情绪,规划共情回复,并将其渲染为带有同步情感语音和面部运动的具身化身视频。回复以匹配的大小显示在用户视图旁边,用户可以重播或旋转3D头部以从新视角观察化身。  
4. ▶ 历史记录(步骤7-8)。对话可随时继续或停止,每一轮都被归档为配对的用户-化身记录,供以后重放。仅在用户导出完整历史记录时才要求进行轻量注册。  

## 4 实现规格  
EmpaAva将用户的音视频输入流转换为可看到、可听到且可回应的具身化身回复。我们不是把整个任务交给一个端到端模型,而是将其分解为由一个LLM协调的三个协作智能体(图3(https://arxiv.org/html/2608.04709#S2.F3)):感知智能体感知用户,响应智能体决定回复内容与方式,渲染智能体将回复实现为3D化身视频。智能体之间通过共享的、人类可读的状态而非不透明的张量通信,因此每个阶段都可独立测试和替换;更强的ASR模型、更大的LLM或更高保真度的渲染器都可以直接替换,而不影响其余部分;正是这种透明性使得流水线易于在第5节(https://arxiv.org/html/2608.04709#S5)中消融。  
### 4.1 感知智能体  
感知智能体将原始用户输入转换为结构化的感知结果。在轻度预处理(格式转换、重采样、降噪)后,自动语音识别转写话语,语音情感识别读取由韵律、音高和节奏所携带的声学情绪。这第二个信号很重要,因为仅凭言语可能误导:一句平淡的话也可能听起来疲惫或焦虑,化身应当回应感受而不仅仅是文本。当摄像头启用时,会采样若干轻量级帧作为视觉上下文。随后,智能体将转录文本、语音情感标签、采样帧、对话历史和输入元数据打包成一个*对话模式*,交给响应智能体。  
### 4.2 响应智能体:共情响应规划  
响应智能体是

相似文章

动态内群体人格生成以增强人机融洽关系

arXiv cs.AI

本文介绍了一种基于LLM的聊天机器人动态生成内群体人格的方法:首先识别用户的主要关切,然后创建一个共享该关切点的合成人格。一项人类受试者研究表明,与基线条件相比,该方法在感知融洽度和用户参与度方面有显著提升。

avatarin 如何利用 GPT-Realtime 构建 24/7 零售智能代理

OpenAI Blog

avatarin 使用 OpenAI 的 GPT-Realtime 为山田电机打造了一个 24/7 多语言购物智能代理,通过自然语音对话引导顾客完成购买。在为期两周的试用中,约有 3 万人使用,92% 的调查反馈为正面评价。