EvolvingAvatar: 随对话展开而自适应的交互式3D头部生成

Hugging Face Daily Papers 论文

摘要

EvolvingAvatar 引入了一个因果性3D头部生成系统,该系统使用测试时训练实时适应对话上下文,在对话场景中增强运动统计。

交互式3D头部生成需要协调说话和倾听的运动,以响应不断发展的对话。现有的生成器使用传入的观测作为上下文,但保持参数固定,导致对话模式未被用作学习信号。我们引入了EvolvingAvatar,一个因果性生成器,它使用测试时训练在交互过程中适应用户面部视频和双音频。其双音频上下文预测目标从视听上下文中提供自监督学习信号,无需在测试时使用目标运动标签。持久快速权重在每次对话内累积这些更新以指导运动生成,而瞬时下颌适应响应当前的视听上下文。预测的语音活动控制持久适应如何指导运动。我们还引入了InterHead-Bench,一个统一的455.95小时基准测试集,由单视角和双视角对话视频构建。实验表明,与强基线相比,对话运动统计有所改善。在最难的分布外划分上,随着对话展开,生成改善,与记录的用户-化身表达统计的不匹配度从第一个区间减少了高达11.1%。
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:17

论文页面 - EvolvingAvatar:随对话展开自适应的交互式3D头部生成技术

来源:https://huggingface.co/papers/2609.35616

摘要

交互式3D头部生成需要协调说话和倾听动作,并能够响应不断发展的对话。现有生成器利用输入观察作为上下文,但保持参数固定,导致对话模式未被用作学习信号。我们引入EvolvingAvatar,一种因果生成器,通过测试时训练在交互过程中适应用户面部视频和双人音频。其双人对话上下文预测目标从视听上下文中提供自监督学习信号,无需测试时的目标动作标签。持久快速权重在每次对话中累积这些更新以指导动作生成,而瞬时下颌适应则响应当前的视听上下文。预测的语音活动控制显示了持久适应如何指导动作生成。我们还介绍了InterHead-Bench,一个基于单视角和双视角对话视频构建的统一455.95小时基准测试集。实验表明,与强基线相比,对话动作统计有所改善。在最具挑战性的分布外分割中,随着对话的展开,生成效果提升,与录制的用户-化身表情统计数据的不匹配度在首个区间后最多减少11.1%。

查看arXiv页面 (https://arxiv.org/abs/2609.35616) 查看PDF (https://arxiv.org/pdf/2609.35616) 项目页面 (https://blog.evolving-avatar.com/) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.35616)

在你的智能体中获取此论文:

hf papers read 2609.35616

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型README.md中引用 arxiv.org/abs/2609.35616 即可从本页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2609.35616 即可从本页面链接。

引用此论文的Spaces 0

没有Space链接此论文

在Space README.md中引用 arxiv.org/abs/2609.35616 即可从本页面链接。

包含此论文的收藏集 0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接。

相似文章

Avatar V:可规模化的视频参考虚拟化身视频生成

Hugging Face Daily Papers

Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。

用语言而非按钮控制3D虚拟角色

Reddit r/LocalLLaMA

一个可以用自然语言描述而非按钮控制的3D虚拟角色,基于programasweights系统构建,该系统可将纯英语编译为神经程序。它在浏览器本地运行,可生成如“走路时挥手,然后跳几下”的动作序列。

FFAvatar: 少样本、前馈、可泛化的头像重建

Hugging Face Daily Papers

FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。