記事一覧へ戻る
視覚・動画

HOMIEが切り開く人-物中心の動画パーソナライズ

読了目安 2 分

導入

主体駆動の動画生成では、人物の見た目を一貫させるだけでは十分ではありません。手に持つ物、触れる物、象徴的なロゴのような対象との関係まで自然に表現できてこそ、動画としての説得力が増します。HOMIE は、この人-物中心の動画パーソナライズ課題に取り組むフレームワークです。

主なポイント

  • 2種類の入力設定を統一的に処理:異なる主体間の個性化と、同一主体に対する多視点やOCRなどの参照入力の両方を扱う。
  • MLLMの知識を活かす設計:テキストエンコーダの制御性を損なわず、再整合に大きなコストをかけずに参照関係を学習する。
  • Global multimodal guidance:自己注意の中に多モーダル誘導を組み込み、MLLM由来の意味特徴とVAEトークンをよりよく整合させる。
  • Modality-reference embedding:異なる由来のトークンを区別しつつ、同一主体の参照画像トークンを結び付ける。

意義

この研究は、動画個性化の難しさが「見た目の再現」と「関係性の再現」の二層に分かれていることを改めて示しています。特に、ロゴや抽象概念のような対象では、単純な外観一致だけでは不十分です。関係の理解を生成過程の中に直接入れるという発想は、今後の動画生成の安定性を高めるうえで重要です。

要約によれば、HOMIE は複数のHOCVPタスクで最先端性能を達成しています。今後は、参照品質や複雑な場面での汎化がどこまで広がるかが焦点になるでしょう。

出典: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
TimeLens2:動画MLLMに「根拠がいつ起きたか」を示させる
視覚・動画
cctest.ai
視覚・動画

TimeLens2:動画MLLMに「根拠がいつ起きたか」を示させる

TimeLens2 は、動画の時間的グラウンディングを可変数の区間集合として扱い、モデルが出来事だけでなく根拠となる時間帯も示せるようにする研究です。2B、4B、8B の各モデルは Qwen3-VL バックボーンから大きな改善を示しています。

続きを読む
CCTest · Blog
FlowMimic:画像編集データから動画編集を学ぶ新しい枠組み
視覚・動画
cctest.ai
視覚・動画

FlowMimic:画像編集データから動画編集を学ぶ新しい枠組み

FlowMimic は、動画編集データの収集コストとタスクの狭さという課題に向き合う研究です。画像編集サンプルをリアルタイムで動画編集サンプルへ変換し、画像と動画の能力を相互模倣で近づけます。

続きを読む
CCTest · Blog
REBASE:背景の影響を消して、学習なしのインコンテキスト分割を改善
視覚・動画
cctest.ai
視覚・動画

REBASE:背景の影響を消して、学習なしのインコンテキスト分割を改善

REBASE は、1枚の注釈付き参照画像から新しい対象を分割する training-free な手法です。参照画像の背景特徴サブスペースを取り除くことで、背景に引きずられた誤った類似度を抑えます。

続きを読む