記事一覧へ戻る
視覚・動画

Wan 3.0公測、動画生成は「資料を映像化する」段階へ

読了目安 2 分

アリババが動画生成モデル Wan 3.0 の公測を開始した。今回の発表が単なる新モデル公開にとどまらないのは、動画生成の役割そのものを広げようとしている点にある。これまでの動画AIは、短い映像を作る「生成ツール」として見られがちだったが、Wan 3.0 は資料や構造化情報を映像に変える方向へ踏み出している。

主なポイント

  • 最長30秒を一度に生成でき、短い断片ではなく、ある程度まとまった物語や説明を表現しやすい。
  • 文書入力に対応し、doc、xls、ppt、pdf、md などを扱えるため、説明資料や企画書をもとに映像化しやすい。
  • リアリティを重視し、人物の表情、肌の質感、動きの自然さ、画面の信頼感を高める方向で設計されている。
  • 編集機能も強化され、映像だけでなく、台詞やストーリーの修正にも対応する。

何が変わるのか

この進化は、動画生成モデルの用途を大きく変える可能性がある。従来は、SNS向けの短尺映像やコンセプト映像が中心だった。しかし、PPT や PDF を直接読み込めるなら、製品紹介、社内説明、研修資料、営業提案など、実務の場面に入りやすくなる。

つまり、Wan 3.0 は「映像を作るモデル」から「情報を伝えるモデル」へ近づいている。テキストをそのまま映像化するだけでなく、資料にある構造や意図を読み取り、視覚的に再構成することが重要になるからだ。

また、「全能参考」と呼ばれる仕組みも意味が大きい。人物、道具、音声、空間関係、スタイルを安定して保つことは、動画生成で最も難しい課題の一つだ。ここが安定すると、偶然うまくできる作品ではなく、継続して使える制作基盤に近づく。

一方で、素材では音質や文字の正確さにまだ改善余地があるともされている。したがって、現時点では完成形というより、実用化に向けた大きな前進と見るのが妥当だろう。

総じて、Wan 3.0 の公測は、動画AIが「見た目の良い短い映像」を超えて、資料・知識・説明を扱う段階に入ったことを示している。今後、API の提供や利用環境が整えば、企業のコンテンツ制作フローに組み込まれる可能性もある。

出典: 量子位

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
動画拡散モデルが物理法則を破る理由――注意機構の盲点
視覚・動画
cctest.ai
視覚・動画

動画拡散モデルが物理法則を破る理由――注意機構の盲点

新たな解釈可能性研究は、動画生成の初期ノイズ除去段階で RoPE が空間的な注意を過度に減衰させ、非現実的な動きを固定する可能性を示した。研究者はノイズ除去ステップに応じて RoPE の周波数を調整する手法を提案している。

続きを読む
CCTest · Blog
Vidu S2、リアルタイムのアバターと動画編集、空間映像を統合
視覚・動画
cctest.ai
視覚・動画

Vidu S2、リアルタイムのアバターと動画編集、空間映像を統合

Vidu S2は、対話型デジタルアバターと動画ストリーム編集をリアルタイムで実行する2つのモデルで構成されます。生成中に指示や参照画像を更新し、映像を継続的に操作するワークフローを目指しています。

続きを読む
CCTest · Blog
ShallowStream:浅い層で索引を作り、深い層で動画を理解する
視覚・動画
cctest.ai
視覚・動画

ShallowStream:浅い層で索引を作り、深い層で動画を理解する

ShallowStreamは、MLLMの浅い層を使ってストリーミング動画の符号化と検索用インデックスの構築を行い、質問時だけ深い層を活用します。論文では、フレーム単位のプリフィル遅延を最大52.1倍、10秒間のエンドツーエンド遅延を最大11.9倍削減したと報告しています。

続きを読む