記事一覧へ戻る
視覚・動画

HOMIEが切り開く人-物中心の動画パーソナライズ

読了目安 2 分

導入

主体駆動の動画生成では、人物の見た目を一貫させるだけでは十分ではありません。手に持つ物、触れる物、象徴的なロゴのような対象との関係まで自然に表現できてこそ、動画としての説得力が増します。HOMIE は、この人-物中心の動画パーソナライズ課題に取り組むフレームワークです。

主なポイント

  • 2種類の入力設定を統一的に処理:異なる主体間の個性化と、同一主体に対する多視点やOCRなどの参照入力の両方を扱う。
  • MLLMの知識を活かす設計:テキストエンコーダの制御性を損なわず、再整合に大きなコストをかけずに参照関係を学習する。
  • Global multimodal guidance:自己注意の中に多モーダル誘導を組み込み、MLLM由来の意味特徴とVAEトークンをよりよく整合させる。
  • Modality-reference embedding:異なる由来のトークンを区別しつつ、同一主体の参照画像トークンを結び付ける。

意義

この研究は、動画個性化の難しさが「見た目の再現」と「関係性の再現」の二層に分かれていることを改めて示しています。特に、ロゴや抽象概念のような対象では、単純な外観一致だけでは不十分です。関係の理解を生成過程の中に直接入れるという発想は、今後の動画生成の安定性を高めるうえで重要です。

要約によれば、HOMIE は複数のHOCVPタスクで最先端性能を達成しています。今後は、参照品質や複雑な場面での汎化がどこまで広がるかが焦点になるでしょう。

出典: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
GeminiにAgentic Video Understanding、動画の「見る場所」を自律判断
視覚・動画
cctest.ai
視覚・動画

GeminiにAgentic Video Understanding、動画の「見る場所」を自律判断

Google DeepMindは、Geminiが動画内の必要な区間を動的に検索・再確認できるAgentic Video Understandingを発表しました。公式ベンチマークでは、トークン使用量を最大88%、分析コストを最大66%削減し、精度を最大7%高めたとしています。

続きを読む
CCTest · Blog
Luce、1枚の画像から再照明可能な3Dアセットを生成
視覚・動画
cctest.ai
視覚・動画

Luce、1枚の画像から再照明可能な3Dアセットを生成

Luceは、形状とPBRマテリアルを統合したマルチモーダルGaussian表現を提案し、1枚の画像から再照明可能な3Dアセットを生成します。PBR Gaussianに加え、テクスチャ付きメッシュと接線空間法線マップも任意で出力できます。

続きを読む