Super Star: 面向数字人类的流式实时交互代理

Hugging Face Daily Papers 论文

摘要

论文提出了 Super Star,一个用于数字人类在线共语手势生成的实时框架,该框架使用因果多模态自回归模型,结合流式语音和用户反馈以实现持续适应。

现有的共语手势生成方法主要在离线设置中进行研究,其中手势是从完整的语音片段中合成的。然而,现实场景中的交互式数字人类需要在严格的延迟约束下,仅使用当前可用的响应音频在线生成语音同步手势。因此,先前的方法不适合实时交互,因为它们要么依赖于未来语音信息,要么会导致较大的推理延迟。本文中,我们为交互式数字人类制定了在线共语手势生成任务,并提出了一个实时交互框架,将流式语音响应模块与在线手势生成模块相结合。具体来说,手势生成器被设计为一个因果多模态自回归模型,从流式响应语音和动作历史中预测身体动作,从而实现低延迟且语音对齐的手势合成,而无需访问未来语音。为支持这一设置,我们进一步提出了一个专门针对虚拟伴侣场景的离线数据合成管道,该管道利用主题和情感感知的主题语料库来构建多样化的机人对话,然后基于代理响应生成共语手势。此外,为弥合离线数据构建和在线部署之间的差距,我们通过将在线交互期间收集的用户反馈纳入数据生成过程,建立了一个自进化训练循环,从而实现对用户偏好的持续适应。大量实验表明,我们的框架在延迟-质量权衡、语音-动作同步性和用户偏好方面均优于竞争性的现有基线。项目页面:https://super-star-2026.github.io/
查看原文
查看缓存全文

缓存时间: 2026/08/27 03:16

论文页面 - Super Star:面向数字人的流式实时交互式智能体

来源:https://huggingface.co/papers/2608.24909

摘要

一个用于在线协同语音手势生成的实时框架,采用因果多模态自回归模型,结合流式语音与动作历史,辅以合成对话数据与持续用户反馈适应机制。

现有协同语音手势生成(https://huggingface.co/papers?q=co-speech%20gesture%20generation)方法主要基于离线场景研究,即从完整语音片段合成手势。然而,真实场景中的交互式数字人需要在严格延迟约束下,仅使用当前可用的响应音频在线生成语音同步手势。因此,现有方法因其依赖未来语音信息或产生显著推理延迟而不适用于实时交互。本文针对交互式数字人定义了在线协同语音手势生成问题(https://huggingface.co/papers?q=co-speech%20gesture%20generation),并提出一个实时交互框架,将流式语音响应(https://huggingface.co/papers?q=streaming%20speech%20response)模块与在线手势生成(https://huggingface.co/papers?q=online%20gesture%20generation)模块相结合。具体而言,手势生成器被设计为因果多模态自回归模型(https://huggingface.co/papers?q=causal%20multimodal%20autoregressive%20model),从流式响应语音和动作历史(https://huggingface.co/papers?q=motion%20history)预测身体运动,从而在无需访问未来语音的情况下实现低延迟、与语音对齐的手势合成。为支持此场景,我们进一步提出针对虚拟伴侣场景的离线数据合成流程,利用主题与情感感知的主体语料库构建多样化的人机对话,然后基于智能体响应生成协同语音手势。此外,为弥合离线数据构建与在线部署间的差距,我们通过将在线交互中收集的用户反馈(https://huggingface.co/papers?q=user%20feedback)纳入数据生成过程,建立了自进化训练循环(https://huggingface.co/papers?q=self-evolving%20training%20loop),实现对用户偏好的持续适应。大量实验表明,我们的框架在延迟-质量权衡(https://huggingface.co/papers?q=latency-quality%20trade-off)、语音-动作同步性及用户偏好度方面均优于现有竞争基线。项目页面:https://super-star-2026.github.io/

查看arXiv页面 (https://arxiv.org/abs/2608.24909)查看PDF (https://arxiv.org/pdf/2608.24909)项目页面 (https://super-star-2026.github.io/)GitHub (https://github.com/PeterIverson/Super-Star)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24909)

在智能体中获取本文:

hf papers read 2608.24909

未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

无模型链接本文

在模型README.md中引用 arxiv.org/abs/2608.24909 以从本页链接。

引用本文的数据集 0

无数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2608.24909 以从本页链接。

引用本文的Spaces 0

无Space链接本文

在Space README.md中引用 arxiv.org/abs/2608.24909 以从本页链接。

包含本文的收藏 0

无收藏包含本文

将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

迈向类人交互式语音识别:基于智能体修正与语义评估

Hugging Face Daily Papers

本文介绍了 Agentic ASR,一种交互式语音识别框架,通过语义修正和基于推理的编辑,利用多轮优化来减少语义错误。同时,提出了一种新的句子级语义错误率指标以及一个用于基准测试的交互式模拟系统。

Wan-Streamer v0.1:端到端实时交互基础模型

Hugging Face Daily Papers

Wan-Streamer是一个统一的端到端多模态模型,用于实时音视频交互,采用因果注意力机制,并集成处理视觉、音频和文本模态,实现了亚秒级延迟。