HOMIE:基于多模态智能增强的人-物中心视频个性化

Hugging Face Daily Papers 论文

摘要

HOMIE是一个用于人-物中心视频个性化的框架,它整合了MLLM特征以提高主体保真度和交互模式,达到了最先进的性能。

人-物中心视频个性化(HOCVP)是主体驱动视频生成中的核心任务。然而,现有方法存在两个关键局限。首先,大多数关注跨主体个性化的方法仍然难以在高主体保真度和人与不同物体之间的准确交互模式之间取得平衡,特别是当物体代表抽象概念(如徽标)时。其次,虽然主体内参考(例如OCR图、多视角输入)有望增强主体保真度,但大多数现有工作缺乏理解这种潜在对应关系的机制。为了应对这两个挑战,我们提出了HOMIE,这是一个统一的HOCVP框架,能够以统一的方式处理跨主体和主体内输入设置。与先前方法相比,HOMIE提出了更好的MLLM集成策略,无需牺牲文本编码器的可控性或付出昂贵的重新对齐成本,即可提取参考级关系的知识。具体而言,我们在自注意力中引入全局多模态引导,以更好地将MLLM衍生的语义特征与VAE令牌对齐。此外,我们提出了模态参考嵌入,以区分来自MLLM特征和VAE令牌的令牌,并关联主体内参考图像令牌。大量实验验证了我们的方法在各种HOCVP任务上达到了最先进的性能。项目页面:https://yiyangcai.github.io/homie-page.github.io/
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:35

论文页面 - HOMIE:基于多模态智能增强的人-物中心视频个性化

来源: https://huggingface.co/papers/2607.18217

摘要

以人为中心的视频个性化(HOCVP)是主体驱动视频生成中的核心任务。然而,现有方法存在两个关键局限性。首先,大多数专注于主体间个性化的方法在保持主体保真度与准确的人-物交互模式之间仍难以取得平衡,尤其是当物体代表抽象概念(如徽标)时。其次,虽然主体内参考(如OCR映射、多视图输入)有望提升主体保真度,但大多数现有工作缺乏理解此类隐式对应关系的机制。为了应对这两大挑战,我们提出了HOMIE,一个以统一方式处理主体间和主体内输入设定的HOCVP框架。与先前方法相比,HOMIE提出了一种更好的多模态大语言模型(MLLM)集成策略,能够在不牺牲文本编码器可控性或引起昂贵的重新对齐的情况下,提取参考级关系的知识。具体来说,我们在自注意力中引入全局多模态引导,以更好地对齐MLLM导出的语义特征与VAE令牌。此外,我们提出模态参考嵌入,用于区分来自MLLM特征和VAE令牌的令牌,并关联主体内参考图像令牌。大量实验验证了我们的方法在各种HOCVP任务上达到了最先进的性能。项目页面:https://yiyangcai.github.io/homie-page.github.io/

查看 arXiv 页面 (https://arxiv.org/abs/2607.18217) 查看 PDF (https://arxiv.org/pdf/2607.18217) 项目页面 (https://yiyangcai.github.io/homie-page.github.io/) GitHub11 (https://github.com/YIYANGCAI/HOMIE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18217)

在您的代理中获取此论文:

hf papers read 2607.18217

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.18217,以从该页面链接。

引用该论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.18217,以从该页面链接。

引用该论文的 Spaces0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.18217,以从该页面链接。

包含该论文的收藏0

没有收藏包含此论文

请将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从该页面链接。

相似文章

PersonaVLM:长期个性化多模态大语言模型

Hugging Face Daily Papers

PersonaVLM 提出了一种个性化多模态大语言模型框架,通过记忆保留、多轮推理和响应对齐实现长期用户适应,在新推出的 Persona-MME 基准测试中比 GPT-4o 高出 5.2%。

unsloth/MiMo-V2.5-GGUF · Hugging Face

Reddit r/LocalLLaMA

MiMo-V2.5 是一款原生全模态 AI 模型,具备强大的智能体(agentic)能力,在统一稀疏混合专家(MoE)架构下支持文本、图像、视频和音频的理解。