REALM:一种用于具身响应式聆听的粗到精生成框架
摘要
本文介绍了REALM,一种用于具身人工智能中音频驱动响应式聆听的粗到精生成框架,解决了时序和面部运动中的挑战,评估和机器人部署展示了改进。
查看缓存全文
缓存时间: 2026/09/29 08:19
论文页面 - REALM:一种用于具身反应性聆听的粗到细生成框架
来源:https://huggingface.co/papers/2609.33095
摘要
生成反应性聆听者的面部运动对于具身对话AI是一项重要任务。两个核心建模挑战在于:既要精确对应说话人提示的时序,又要保持与聆听者当前运动的连续性;同时既要捕捉整体运动轨迹,又要体现面部表情的局部变化。聆听者的反应可能滞后于先前的提示,而短暂的表情和眨眼则引入难以确定性预测的变数。这些挑战促使我们设计了一个结合历史感知时序对齐与随机表情细化的框架。我们提出 REALM(反应性具身音频驱动聆听模型),这是一种用于音频驱动反应性聆听的粗到细框架。反应性门控说话人-聆听者融合模块通过延迟中心注意力先验和自适应门控,将聆听者的运动历史与说话人音频相结合。粗解码器预测基础运动轨迹,然后通过音频条件的随机残差在表情子空间中进行增强,同时保留粗略的姿态参数。在 ViCo 和 L2L 上的评估显示,该框架在多个运动质量指标上均优于基线方法。进一步分析研究了延迟敏感性、门控行为和眨眼动态。最后,在 Ameca 人形机器人上的部署以及感知用户研究验证了生成行为适用于物理具身。代码:https://github.com/lipzh5/REALM 演示:https://youtu.be/Tf5mpd5S8VQ
查看 arXiv 页面 (https://arxiv.org/abs/2609.33095) 查看 PDF (https://arxiv.org/pdf/2609.33095) 项目页面 (https://www.youtube.com/watch?v=Tf5mpd5S8VQ) GitHub24 (https://github.com/lipzh5/REALM) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.33095)
通过代理获取此论文:
hf papers read 2609.33095
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
没有模型链接到本文
在模型 README.md 中引用 arxiv.org/abs/2609.33095 以从本页面链接到该模型。
引用本文的数据集 0
没有数据集链接到本文
在数据集 README.md 中引用 arxiv.org/abs/2609.33095 以从本页面链接到该数据集。
引用本文的 Spaces 0
没有 Space 链接到本文
在 Space README.md 中引用 arxiv.org/abs/2609.33095 以从本页面链接到该 Space。
包含本文的收藏夹 0
没有收藏夹包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接到它。
相似文章
REALMS:基于高维嵌套画像的实时精确受众规模测量AI辅助对话系统
REALMS是一个用于实时精确受众规模测量的对话AI系统,使用LLMs和嵌入技术,使营销人员能够用自然语言查询高维画像数据,并在生产环境中快速获得精确计数。
持久故事与交互式世界的长时间音视频生成
本文介绍了JoyAI-Echo-1.5,这是一个统一的音视频生成系统,适用于长视频和交互式世界,使用跨镜头记忆和几何感知控制来保持连贯性和持久性。
先听后说:基于听者面部反应的对话语音生成响应规划
本文提出ReACT-TTS框架,该框架在话语实现前利用听者面部反应来规划对话语音响应的情感和韵律。
REARL:基于真实交通数据和大型语言模型的闭环自动驾驶模拟增强框架
本文提出了REARL,一个使用真实交通数据和大型语言模型的闭环框架,通过持续监控和调整车辆行为来增强自动驾驶模拟的真实性。
PRISM:面向共情口语对话的韵律集成多智能体推理框架
PRISM 是一个多智能体框架,通过将语音感知、响应生成和语音合成解耦,并结合韵律线索与大语言模型推理及外部知识工具,以提升共情口语对话的质量。