EvolvingAvatar: 随对话展开而自适应的交互式3D头部生成
摘要
EvolvingAvatar 引入了一个因果性3D头部生成系统,该系统使用测试时训练实时适应对话上下文,在对话场景中增强运动统计。
查看缓存全文
缓存时间: 2026/09/29 08:17
论文页面 - EvolvingAvatar:随对话展开自适应的交互式3D头部生成技术
来源:https://huggingface.co/papers/2609.35616
摘要
交互式3D头部生成需要协调说话和倾听动作,并能够响应不断发展的对话。现有生成器利用输入观察作为上下文,但保持参数固定,导致对话模式未被用作学习信号。我们引入EvolvingAvatar,一种因果生成器,通过测试时训练在交互过程中适应用户面部视频和双人音频。其双人对话上下文预测目标从视听上下文中提供自监督学习信号,无需测试时的目标动作标签。持久快速权重在每次对话中累积这些更新以指导动作生成,而瞬时下颌适应则响应当前的视听上下文。预测的语音活动控制显示了持久适应如何指导动作生成。我们还介绍了InterHead-Bench,一个基于单视角和双视角对话视频构建的统一455.95小时基准测试集。实验表明,与强基线相比,对话动作统计有所改善。在最具挑战性的分布外分割中,随着对话的展开,生成效果提升,与录制的用户-化身表情统计数据的不匹配度在首个区间后最多减少11.1%。
查看arXiv页面 (https://arxiv.org/abs/2609.35616) 查看PDF (https://arxiv.org/pdf/2609.35616) 项目页面 (https://blog.evolving-avatar.com/) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.35616)
在你的智能体中获取此论文:
hf papers read 2609.35616
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.35616 即可从本页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.35616 即可从本页面链接。
引用此论文的Spaces 0
没有Space链接此论文
在Space README.md中引用 arxiv.org/abs/2609.35616 即可从本页面链接。
包含此论文的收藏集 0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接。
相似文章
Avatar V:可规模化的视频参考虚拟化身视频生成
Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。
EmpaAva:一个开源的智能体3D虚拟形象共情实时聊天机器人
本文介绍了EmpaAva,据我们所知,这是首个开源的智能体3D虚拟形象共情聊天机器人,通过三智能体LLM架构实现实时的、面对面的多模态共情,在情感理解、响应质量和视听一致性方面超越了基线系统。
SpatialAvatar-0:基于多阶段重建的高质量4D头部虚拟形象
SpatialAvatar-0 提出了一种基于共享 FLAME 网格绑定高斯表示的多阶段重建方法,用于高质量4D头部虚拟形象,在多个基准测试中实现了更优性能,且迭代次数更少。
用语言而非按钮控制3D虚拟角色
一个可以用自然语言描述而非按钮控制的3D虚拟角色,基于programasweights系统构建,该系统可将纯英语编译为神经程序。它在浏览器本地运行,可生成如“走路时挥手,然后跳几下”的动作序列。
FFAvatar: 少样本、前馈、可泛化的头像重建
FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。