Super Star: 面向数字人类的流式实时交互代理
摘要
论文提出了 Super Star,一个用于数字人类在线共语手势生成的实时框架,该框架使用因果多模态自回归模型,结合流式语音和用户反馈以实现持续适应。
查看缓存全文
缓存时间: 2026/08/27 03:16
论文页面 - Super Star:面向数字人的流式实时交互式智能体
来源:https://huggingface.co/papers/2608.24909
摘要
一个用于在线协同语音手势生成的实时框架,采用因果多模态自回归模型,结合流式语音与动作历史,辅以合成对话数据与持续用户反馈适应机制。
现有协同语音手势生成(https://huggingface.co/papers?q=co-speech%20gesture%20generation)方法主要基于离线场景研究,即从完整语音片段合成手势。然而,真实场景中的交互式数字人需要在严格延迟约束下,仅使用当前可用的响应音频在线生成语音同步手势。因此,现有方法因其依赖未来语音信息或产生显著推理延迟而不适用于实时交互。本文针对交互式数字人定义了在线协同语音手势生成问题(https://huggingface.co/papers?q=co-speech%20gesture%20generation),并提出一个实时交互框架,将流式语音响应(https://huggingface.co/papers?q=streaming%20speech%20response)模块与在线手势生成(https://huggingface.co/papers?q=online%20gesture%20generation)模块相结合。具体而言,手势生成器被设计为因果多模态自回归模型(https://huggingface.co/papers?q=causal%20multimodal%20autoregressive%20model),从流式响应语音和动作历史(https://huggingface.co/papers?q=motion%20history)预测身体运动,从而在无需访问未来语音的情况下实现低延迟、与语音对齐的手势合成。为支持此场景,我们进一步提出针对虚拟伴侣场景的离线数据合成流程,利用主题与情感感知的主体语料库构建多样化的人机对话,然后基于智能体响应生成协同语音手势。此外,为弥合离线数据构建与在线部署间的差距,我们通过将在线交互中收集的用户反馈(https://huggingface.co/papers?q=user%20feedback)纳入数据生成过程,建立了自进化训练循环(https://huggingface.co/papers?q=self-evolving%20training%20loop),实现对用户偏好的持续适应。大量实验表明,我们的框架在延迟-质量权衡(https://huggingface.co/papers?q=latency-quality%20trade-off)、语音-动作同步性及用户偏好度方面均优于现有竞争基线。项目页面:https://super-star-2026.github.io/
查看arXiv页面 (https://arxiv.org/abs/2608.24909)查看PDF (https://arxiv.org/pdf/2608.24909)项目页面 (https://super-star-2026.github.io/)GitHub (https://github.com/PeterIverson/Super-Star)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24909)
在智能体中获取本文:
hf papers read 2608.24909
未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
无模型链接本文
在模型README.md中引用 arxiv.org/abs/2608.24909 以从本页链接。
引用本文的数据集 0
无数据集链接本文
在数据集README.md中引用 arxiv.org/abs/2608.24909 以从本页链接。
引用本文的Spaces 0
无Space链接本文
在Space README.md中引用 arxiv.org/abs/2608.24909 以从本页链接。
包含本文的收藏 0
无收藏包含本文
将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
ARDY: 混合表示的自回归扩散用于交互式人体运动生成
ARDY 引入了一个流式生成框架,用于实时、高保真度的 3D 人体运动生成,通过文本和运动学约束进行控制,采用混合表示和两阶段自回归 Transformer 去噪器。
迈向类人交互式语音识别:基于智能体修正与语义评估
本文介绍了 Agentic ASR,一种交互式语音识别框架,通过语义修正和基于推理的编辑,利用多轮优化来减少语义错误。同时,提出了一种新的句子级语义错误率指标以及一个用于基准测试的交互式模拟系统。
Wan-Streamer v0.1:端到端实时交互基础模型
Wan-Streamer是一个统一的端到端多模态模型,用于实时音视频交互,采用因果注意力机制,并集成处理视觉、音频和文本模态,实现了亚秒级延迟。
AI社交应用是否正从文字聊天转向实时视频交互?
讨论AI社交应用从文字聊天到实时视频交互的演变,重点介绍了Mel的多模态交互栈以及延迟、唇形同步和协调等技术挑战。
Higgsfield 推出了他们所称的首个完全自动化 AI 视频代理——是真正的变革还是又一次炒作?
Higgsfield 推出了 Supercomputer,被描述为首个用于端到端视频创作的完全自动化 AI 代理,能够通过单一聊天界面规划、生成和发布长达数分钟的视频,但目前存在一些漏洞,长输出中连贯性有问题。