HOMIEが切り開く人-物中心の動画パーソナライズ
読了目安 2 分
導入
主体駆動の動画生成では、人物の見た目を一貫させるだけでは十分ではありません。手に持つ物、触れる物、象徴的なロゴのような対象との関係まで自然に表現できてこそ、動画としての説得力が増します。HOMIE は、この人-物中心の動画パーソナライズ課題に取り組むフレームワークです。
主なポイント
- 2種類の入力設定を統一的に処理:異なる主体間の個性化と、同一主体に対する多視点やOCRなどの参照入力の両方を扱う。
- MLLMの知識を活かす設計:テキストエンコーダの制御性を損なわず、再整合に大きなコストをかけずに参照関係を学習する。
- Global multimodal guidance:自己注意の中に多モーダル誘導を組み込み、MLLM由来の意味特徴とVAEトークンをよりよく整合させる。
- Modality-reference embedding:異なる由来のトークンを区別しつつ、同一主体の参照画像トークンを結び付ける。
意義
この研究は、動画個性化の難しさが「見た目の再現」と「関係性の再現」の二層に分かれていることを改めて示しています。特に、ロゴや抽象概念のような対象では、単純な外観一致だけでは不十分です。関係の理解を生成過程の中に直接入れるという発想は、今後の動画生成の安定性を高めるうえで重要です。
要約によれば、HOMIE は複数のHOCVPタスクで最先端性能を達成しています。今後は、参照品質や複雑な場面での汎化がどこまで広がるかが焦点になるでしょう。
コメント
ログイン状態を確認中…
コメントを読み込み中…