返回文章列表
视觉与视频

HOMIE:让视频里的“人-物关系”更稳定、更可控

阅读约 2 分钟

导语

在主体驱动视频生成里,“把一个人生成得像”只是第一步,更难的是让他和不同物体之间的互动也合理自然。比如手拿品牌 logo、与抽象概念道具互动,模型不仅要保住身份特征,还要理解对象本身的语义。HOMIE 就是围绕这一类人-对象中心视频个性化(HOCVP)问题提出的新框架。

核心要点

  • 同时处理两类输入场景:既考虑不同主体之间的个性化生成,也考虑同一主体的多种参考信息,如 OCR 图、 多视角输入等。
  • 更强的多模态大模型接入方式:作者认为,既有方法往往难以理解参考之间的潜在对应关系,或者会牺牲文本编码器的可控性。
  • 全局多模态引导:HOMIE 在自注意力中加入全局多模态 guidance,让多模态大模型提取的语义特征更好地对齐 VAE token。
  • 模态-参考嵌入:通过区分来自 MLLM 特征和 VAE token 的不同来源,并关联同一主体的参考图像 token,增强内部参考信息的表达。

这篇工作的意义

这类方法的价值,不只是“更像某个人”,而是让视频生成模型真正理解“人和物如何发生关系”。对于品牌展示、虚拟代言、角色内容生成等场景,主体一致性和交互准确性往往同样重要。HOMIE 的思路说明,未来的视频个性化不仅要靠更强的视觉先验,也需要更细的跨模态关系建模。

论文摘要强调,该方法在多个 HOCVP 任务上取得了更好的结果。不过从应用角度看,这类模型离真正可用还取决于数据覆盖、参考质量和复杂交互场景的泛化能力。

来源链接:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
FlowMimic:用像素对流场把图像编辑“迁移”到视频编辑
视觉与视频
cctest.ai
视觉与视频

FlowMimic:用像素对流场把图像编辑“迁移”到视频编辑

这篇工作试图解决一个长期痛点:视频编辑数据难采、成本高、任务类型又不够丰富。FlowMimic提出一种不用掩码的生成与编辑框架,把图像编辑样本实时转成视频编辑样本,并让模型在图像与视频两种模态之间相互“模仿”。

阅读全文