HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement
作者: Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo
分类: cs.CV
发布日期: 2026-07-20
备注: 28 pages, 14 figures
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出HOMIE框架以解决人机交互视频个性化问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 人机交互 视频个性化 多模态学习 大语言模型 变分自编码器 语义对齐 主题生成
📋 核心要点
- 现有的人机中心视频个性化方法在主题保真度与人机交互模式的准确性之间难以取得平衡,尤其在处理抽象对象时表现不佳。
- HOMIE框架通过统一处理跨主题和同主题输入,采用多模态大语言模型集成策略,提升了人机交互视频的个性化效果。
- 大量实验验证了HOMIE在多项HOCVP任务中达到了最先进的性能,显示出其在视频个性化领域的有效性。
📝 摘要(中文)
人机中心的视频个性化(HOCVP)是基于主题的视频生成中的核心任务。然而,现有方法存在两大主要局限性:一是难以在高主题保真度与人类与多样对象之间的准确交互模式之间取得平衡,尤其是当对象代表抽象概念时;二是现有方法缺乏理解潜在对应关系的机制。为了解决这些挑战,本文提出了HOMIE框架,统一处理跨主题和同主题输入设置。HOMIE通过更好的多模态大语言模型(MLLM)集成策略,提取参考级关系的知识,同时保持文本编码器的可控性。实验结果表明,HOMIE在多项HOCVP任务中实现了最先进的性能。
🔬 方法详解
问题定义:本文旨在解决人机中心视频个性化(HOCVP)中的两大挑战:一是跨主题个性化的高保真度与准确交互模式的平衡,二是缺乏对同主题参考的潜在对应关系的理解。
核心思路:HOMIE框架通过统一处理跨主题和同主题输入,采用多模态大语言模型(MLLM)集成策略,提取参考级关系的知识,提升了个性化效果。
技术框架:HOMIE的整体架构包括全局多模态引导与自注意力机制,以更好地对齐MLLM派生的语义特征与变分自编码器(VAE)标记。此外,提出了模态-参考嵌入,以区分MLLM特征和VAE标记。
关键创新:HOMIE的主要创新在于其改进的MLLM集成策略,能够在不影响文本编码器可控性的前提下,提取有效的参考级关系知识,这与现有方法的处理方式有本质区别。
关键设计:在设计中,HOMIE采用了全局多模态引导机制,结合自注意力机制,确保了MLLM派生的语义特征与VAE标记的有效对齐,同时引入模态-参考嵌入以增强同主题参考图像标记的关联性。
🖼️ 关键图片
📊 实验亮点
HOMIE在多项HOCVP任务中表现出色,实验结果显示其在多个基准测试中超越了现有方法,具体性能提升幅度达到XX%,展现了其在视频个性化领域的领先地位。
🎯 应用场景
HOMIE框架在视频个性化领域具有广泛的应用潜力,尤其适用于广告、教育和娱乐等行业。通过提升人机交互的个性化程度,能够显著增强用户体验,推动相关产业的发展。未来,HOMIE的技术可以扩展到其他多模态生成任务中,进一步提升其应用价值。
📄 摘要(原文)
Human-object centric video personalization (HOCVP) is a core task within subject-driven video generation. However, existing methods suffer from two key limitations. First, most approaches focusing on inter-subject personalization still struggle to strike a balance between high subject fidelity and accurate interaction patterns between humans and diverse objects, especially when objects represent abstract concepts such as logos. Second, while intra-subject references (e.g., OCR maps, multi-view inputs) are expected to enhance subject fidelity, most existing works lack mechanisms to understand such latent correspondence. To address both challenges, we propose HOMIE, an HOCVP framework that tackles both inter- and intra-subject input settings in a unified manner. Compared to previous approaches, HOMIE proposes a better MLLM integration strategy to extract knowledge of reference-level relationships without compromising the controllability of text encoders or incurring costly re-alignment. Specifically, we introduce global multimodal guidance within self-attention to better align MLLM-derived semantic features with VAE tokens. Furthermore, we propose modality-reference embedding to differentiate tokens from MLLM features and VAE tokens and associate intra-subject reference image tokens. Extensive experiments validate that our method achieves state-of-the-art performance across various HOCVP tasks. Project Page: https://yiyangcai.github.io/homie-page.github.io/