記事一覧へ戻る
視覚・動画

Vidu S2、リアルタイムのアバターと動画編集、空間映像を統合

読了目安 4 分

概要

動画生成モデルの多くは、プロンプトを入力して処理を待ち、完成したクリップを受け取るオフライン型の流れを前提にしています。この方法では、一度生成を始めた後にキャラクターやシーンを変更することが難しく、対話的な用途には制約があります。Vidu S2は、デジタルアバターの生成と動画編集をリアルタイム処理として設計し、入力される指示、参照画像、映像の変化に合わせて出力を更新することを目指します。

2つのモデル

Vidu S2は、用途の異なる2つのモデルから構成されます。

  • Vidu S2-Avatar:対話型デジタルキャラクター向けのモデルです。公開説明では、720pのリアルタイム動画を25~42 FPSで生成し、ダンスのような動作指示への追従や、より表現力のある全身動作に対応します。会話中に新しい参照画像を追加し、服装、物体、シーンを変更することも可能とされています。
  • Vidu S2-Editing:入力される動画ストリームをリアルタイムに変換するモデルです。元映像の動きとタイミングを保ちながら、スタイル変換、バーチャル試着、人物置換、背景置換を行います。

両者の課題は同じではありません。アバターには、人物の同一性、指示への反応、動作の連続性が求められます。一方、編集モデルには、元の演技やカメラ動作を壊さずに映像要素だけを置き換える能力が必要です。

一度きりの生成から継続的な操作へ

S2-Avatarの特徴の一つは、生成の途中で参照情報を更新できる点です。従来のワークフローでは、服装や背景を変更するために最初から再生成する必要がある場合があります。動的参照が安定して機能すれば、ユーザーはセッションを終えずにキャラクターや環境を変更できます。

S2-Editingも、完成済みファイルだけでなく入力中の映像を対象にします。リアルタイムの仮想プレゼンター、ライブ演出、試着体験、インタラクティブな映像制作などへの応用が考えられます。ただし、提供された資料には詳細な遅延、必要なハードウェア、商用環境での可用性は記載されていません。そのため、紹介された機能を直ちにあらゆる本番環境で利用できると判断するのは早計です。

空間映像への拡張

Vidu S2は、アバターと編集映像の両方について、リアルタイムの空間映像生成も検討しています。立体映像では、左右の視点に対応する画像だけでなく、深度、動き、シーン構造の整合性も必要です。通常の2D動画生成よりも幾何的な安定性が重要になる領域です。

この方向性は、VR向けキャラクター、没入型ライブ、空間コンテンツ制作につながる可能性があります。一方、公開情報では対応機器、深度品質、ユーザー評価などの詳細は示されていません。現時点では、完成した仕様というより、研究・製品化に向けた拡張として捉えるのが適切です。

評価結果の読み方

開発側は、アバター生成と動画編集を含む5つの公開ベンチマークで、Vidu S2がすべての比較対象を上回ったと説明しています。これは単一のオフライン指標ではなく、生成、編集、リアルタイム性を含む広いシステムを目指していることを示します。ただし、提供資料にはベンチマーク名、スコア、実験条件が掲載されていないため、性能差の詳細は技術報告書で確認する必要があります。

Vidu S2の意義は、動画を一度生成して終わる成果物から、継続的に操作できるメディアへ近づけようとしている点にあります。人物の一貫性、動きの安定性、画質、遅延、コストを実環境で両立できるかが、今後の実用性を左右するでしょう。

オンラインデモ:Vidu Stream

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ShallowStream:浅い層で索引を作り、深い層で動画を理解する
視覚・動画
cctest.ai
視覚・動画

ShallowStream:浅い層で索引を作り、深い層で動画を理解する

ShallowStreamは、MLLMの浅い層を使ってストリーミング動画の符号化と検索用インデックスの構築を行い、質問時だけ深い層を活用します。論文では、フレーム単位のプリフィル遅延を最大52.1倍、10秒間のエンドツーエンド遅延を最大11.9倍削減したと報告しています。

続きを読む