CoInteract:通过空间结构化协同生成实现物理一致的人-物交互视频合成

Hugging Face Daily Papers 论文

摘要

CoInteract 提出端到端 Diffusion Transformer 框架,联合建模 RGB 外观与 HOI 几何,在零推理开销下生成物理合理、手脸稳定的人-物交互视频。

合成人–物交互(HOI)视频在电商、数字广告与虚拟营销中具有广泛实用价值。然而,现有扩散模型尽管能渲染逼真画面,仍常出现两大问题:(i) 手、脸等敏感区域结构不稳定;(ii) 接触物理不合理(如手–物穿透)。我们提出 CoInteract,一个端到端 HOI 视频合成框架,输入包括人物参考图、商品参考图、文本提示与语音音频。CoInteract 在 Diffusion Transformer(DiT)主干中嵌入两项互补设计: 1. 人体感知混合专家(Human-Aware MoE):通过空间监督路由将 token 分派给轻量级区域专用专家,以极小参数开销提升细粒度结构保真度。 2. 空间结构化协同生成:双路训练范式,联合建模 RGB 外观流与辅助 HOI 结构流,注入交互几何先验。训练时,HOI 流关注 RGB token,其监督正则化共享主干权重;推理时移除 HOI 分支,实现零额外开销的 RGB 生成。 实验表明,CoInteract 在结构稳定性、逻辑一致性与交互真实感上显著优于现有方法。
查看原文
查看缓存全文

缓存时间: 2026/04/22 06:17

论文页面 - CoInteract:通过空间结构化协同生成实现物理一致的人-物交互视频合成

来源:https://huggingface.co/papers/2604.19636
发布时间:4 月 21 日

·

提交者:https://huggingface.co/XuGuo699

xuguo(https://huggingface.co/XuGuo699)于 4 月 22 日

摘要

CoInteract 提出了一种端到端的人-物交互视频合成框架,以 Diffusion Transformer 为主干,并引入专门模块保证结构稳定与物理合理。
人-物交互(HOI)视频合成在电商、数字广告与虚拟营销中具有广泛实用价值。然而,现有扩散模型尽管能渲染出逼真画面,仍常出现:
(i) 手、脸等敏感区域结构不稳定;
(ii) 接触物理不合理(如手穿模)。
我们提出 CoInteract,一个端到端的 HOI 视频合成框架,输入包括人物参考图、商品参考图、文本提示与语音音频。CoInteract 在 Diffusion Transformer(DiT)主干中嵌入两项互补设计:

  1. 人感混合专家(Human-Aware MoE):通过空间监督路由将 token 分配给轻量级、区域专用专家,以极小参数开销提升细粒度结构保真度;
  2. 空间结构化协同生成(Spatially-Structured Co-Generation):双路训练范式,联合建模 RGB 外观流与辅助 HOI 结构流,注入交互几何先验。训练时,HOI 流关注 RGB token,其监督正则化共享主干权重;推理时,HOI 分支被移除,实现零额外开销的 RGB 生成。实验表明,CoInteract 在结构稳定性、逻辑一致性与交互真实感上显著优于现有方法。

查看 arXiv 页面(https://arxiv.org/abs/2604.19636)
查看 PDF(https://arxiv.org/pdf/2604.19636)
项目主页(https://xinxiaozhe12345.github.io/CoInteract_Project/)
GitHub11(https://github.com/luoxyhappy/CoInteract)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.19636)

在智能体中获取该论文:

hf papers read 2604.19636

尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 1

georgexin/cointeract

文本到视频 • 约 4 小时前更新(https://huggingface.co/georgexin/cointeract)

引用该论文的数据集 0

暂无数据集链接该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.19636 即可在此显示。

引用该论文的 Spaces 0

暂无 Space 链接该论文
在 Space README.md 中引用 arxiv.org/abs/2604.19636 即可在此显示。

收录该论文的合集 0

暂无合集收录该论文
将该论文加入合集(https://huggingface.co/new-collection)即可在此显示。

相似文章

OneHOI:统一人物-物体交互生成与编辑

Hugging Face Daily Papers

OneHOI 是一个统一的扩散 Transformer 框架,通过关系建模和结构化注意力机制将人物-物体交互(HOI)生成和编辑整合为单一的条件去噪过程。该方法在 HOI 生成和编辑两项任务上都达到了最先进的性能,并支持多种控制模式。