HOMIE:基于多模态智能增强的人-物中心视频个性化
摘要
HOMIE是一个用于人-物中心视频个性化的框架,它整合了MLLM特征以提高主体保真度和交互模式,达到了最先进的性能。
查看缓存全文
缓存时间: 2026/07/21 06:35
论文页面 - HOMIE:基于多模态智能增强的人-物中心视频个性化
来源: https://huggingface.co/papers/2607.18217
摘要
以人为中心的视频个性化(HOCVP)是主体驱动视频生成中的核心任务。然而,现有方法存在两个关键局限性。首先,大多数专注于主体间个性化的方法在保持主体保真度与准确的人-物交互模式之间仍难以取得平衡,尤其是当物体代表抽象概念(如徽标)时。其次,虽然主体内参考(如OCR映射、多视图输入)有望提升主体保真度,但大多数现有工作缺乏理解此类隐式对应关系的机制。为了应对这两大挑战,我们提出了HOMIE,一个以统一方式处理主体间和主体内输入设定的HOCVP框架。与先前方法相比,HOMIE提出了一种更好的多模态大语言模型(MLLM)集成策略,能够在不牺牲文本编码器可控性或引起昂贵的重新对齐的情况下,提取参考级关系的知识。具体来说,我们在自注意力中引入全局多模态引导,以更好地对齐MLLM导出的语义特征与VAE令牌。此外,我们提出模态参考嵌入,用于区分来自MLLM特征和VAE令牌的令牌,并关联主体内参考图像令牌。大量实验验证了我们的方法在各种HOCVP任务上达到了最先进的性能。项目页面:https://yiyangcai.github.io/homie-page.github.io/
查看 arXiv 页面 (https://arxiv.org/abs/2607.18217) 查看 PDF (https://arxiv.org/pdf/2607.18217) 项目页面 (https://yiyangcai.github.io/homie-page.github.io/) GitHub11 (https://github.com/YIYANGCAI/HOMIE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18217)
在您的代理中获取此论文:
hf papers read 2607.18217
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.18217,以从该页面链接。
引用该论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.18217,以从该页面链接。
引用该论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.18217,以从该页面链接。
包含该论文的收藏0
没有收藏包含此论文
请将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从该页面链接。
相似文章
HarmoHOI: 协调外观与3D运动的多视角手物交互合成
HarmoHOI是一个统一扩散框架,联合生成同步的多视角手物交互视频和全局对齐的3D点轨迹,在视觉质量、运动合理性和多视角几何一致性方面取得了最先进的性能。
在长期用户交互中个性化具身多模态大语言模型智能体
本文提出Polar,一种多模态记忆增强框架,用于在长期用户交互中个性化具身MLLM智能体,利用知识图谱和情景记忆从累积上下文中定位用户意图的实例。
PersonaVLM:长期个性化多模态大语言模型
PersonaVLM 提出了一种个性化多模态大语言模型框架,通过记忆保留、多轮推理和响应对齐实现长期用户适应,在新推出的 Persona-MME 基准测试中比 GPT-4o 高出 5.2%。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
unsloth/MiMo-V2.5-GGUF · Hugging Face
MiMo-V2.5 是一款原生全模态 AI 模型,具备强大的智能体(agentic)能力,在统一稀疏混合专家(MoE)架构下支持文本、图像、视频和音频的理解。