REALM:一种用于具身响应式聆听的粗到精生成框架

Hugging Face Daily Papers 论文

摘要

本文介绍了REALM,一种用于具身人工智能中音频驱动响应式聆听的粗到精生成框架,解决了时序和面部运动中的挑战,评估和机器人部署展示了改进。

生成响应式听众面部运动是具身对话人工智能的一项重要任务。两个主要的建模挑战是:考虑说话者线索的时序,同时保持与听众持续运动的连续性,并捕捉整体运动轨迹中的局部可变面部事件。听众响应可能跟随先前的线索存在时滞,而短暂的表情和眨眼引入了难以确定性预测的变化。这些挑战促使了一个结合历史感知时序对齐与随机表情精化的框架。我们提出REALM(响应式具身音频驱动聆听模型),一种用于音频驱动响应式聆听的粗到精框架。一个响应式门控说话者-听众融合模块通过以延迟为中心的注意力先验和自适应门控,将听众运动历史与说话者音频结合。一个粗解码器预测基础运动轨迹,通过表达子空间中音频条件的随机残差进行增强,同时保留粗略姿态参数。在ViCo和L2L上的评估显示,在多个运动质量指标上优于评估的基线。额外的分析探讨了延迟敏感性、门控行为和眨眼动态。最后,在Ameca人形机器人上的部署和一项感知用户研究表明了生成行为对物理具身的适用性。 代码:https://github.com/lipzh5/REALM 演示:https://youtu.be/Tf5mpd5S8VQ
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:19

论文页面 - REALM:一种用于具身反应性聆听的粗到细生成框架

来源:https://huggingface.co/papers/2609.33095

摘要

生成反应性聆听者的面部运动对于具身对话AI是一项重要任务。两个核心建模挑战在于:既要精确对应说话人提示的时序,又要保持与聆听者当前运动的连续性;同时既要捕捉整体运动轨迹,又要体现面部表情的局部变化。聆听者的反应可能滞后于先前的提示,而短暂的表情和眨眼则引入难以确定性预测的变数。这些挑战促使我们设计了一个结合历史感知时序对齐与随机表情细化的框架。我们提出 REALM(反应性具身音频驱动聆听模型),这是一种用于音频驱动反应性聆听的粗到细框架。反应性门控说话人-聆听者融合模块通过延迟中心注意力先验和自适应门控,将聆听者的运动历史与说话人音频相结合。粗解码器预测基础运动轨迹,然后通过音频条件的随机残差在表情子空间中进行增强,同时保留粗略的姿态参数。在 ViCo 和 L2L 上的评估显示,该框架在多个运动质量指标上均优于基线方法。进一步分析研究了延迟敏感性、门控行为和眨眼动态。最后,在 Ameca 人形机器人上的部署以及感知用户研究验证了生成行为适用于物理具身。代码:https://github.com/lipzh5/REALM 演示:https://youtu.be/Tf5mpd5S8VQ

查看 arXiv 页面 (https://arxiv.org/abs/2609.33095) 查看 PDF (https://arxiv.org/pdf/2609.33095) 项目页面 (https://www.youtube.com/watch?v=Tf5mpd5S8VQ) GitHub24 (https://github.com/lipzh5/REALM) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.33095)

通过代理获取此论文:

hf papers read 2609.33095

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有模型链接到本文

在模型 README.md 中引用 arxiv.org/abs/2609.33095 以从本页面链接到该模型。

引用本文的数据集 0

没有数据集链接到本文

在数据集 README.md 中引用 arxiv.org/abs/2609.33095 以从本页面链接到该数据集。

引用本文的 Spaces 0

没有 Space 链接到本文

在 Space README.md 中引用 arxiv.org/abs/2609.33095 以从本页面链接到该 Space。

包含本文的收藏夹 0

没有收藏夹包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接到它。

相似文章