記事一覧へ戻る
マルチモーダル

LAION-BVD、マルチモーダル学習向けに1000万時間の公開動画を提供

読了目安 3 分

概要

動画は、映像、動き、音声、時間的な関係を同時に含むため、マルチモーダルモデルにとって非常に豊かな学習源です。一方で、大規模な動画を収集し、不要部分を除き、学習可能な単位へ分割する作業は容易ではありません。LAION-BVDは、公開ウェブ上の動画を活用し、動画・音声・画像を横断する事前学習基盤を構築しようとする取り組みです。

主なポイント

  • URL発見から大規模化。 Common Crawlから約13億件のプラットフォーム由来動画URLを集め、そのうち約8000万本をダウンロードしました。合計時間は1000万時間に達します。ただし、これは発見されたURLと取得できた動画の規模であり、すべての動画が将来も利用可能であることを意味しません。
  • 動画全体ではなくシーンを利用。 内容を考慮したシーン検出によって動画を分割し、学習に適したクリップを抽出します。これにより、長い動画に含まれる無関係な部分を減らし、出来事や動作、画面変化に焦点を当てやすくなります。
  • 合成キャプションで監督信号を拡張。 抽出したクリップには、動画内容と音声に関するキャプションを合成します。人手ラベルの少ないウェブ動画を大規模学習へ組み込める一方、生成された説明には誤りや偏りが含まれる可能性があり、利用時の検証が必要です。
  • 動画フレームを画像データとして活用。 シーンが変化する箇所からフレームを取り出し、画像テキスト学習への代替ソースとして調べています。これらのフレームは一般的なウェブ画像コーパスとは異なる視覚分布を示します。
  • 複数の評価課題を対象。 学習済みモデルは動画テキストおよび音声テキストのベンチマークで競争力を示し、抽出フレームも画像テキスト検索で強い結果につながりました。学習規模やモデル規模を拡大すると、改善が続く傾向も報告されています。

意義と課題

LAION-BVDの重要性は、単に動画本数が多いことだけではありません。動画クリップ、音声説明、シーン変化フレームを同じ公開処理体系から提供し、複数モダリティを組み合わせた研究を進めやすくしている点にあります。高価な商用動画データへアクセスできない研究チームにとって、動画理解、音声・映像アラインメント、クロスモーダル検索を試すための基盤になり得ます。

ただし、規模がデータ品質の問題を解消するわけではありません。権利関係、アクセスの継続性、重複、言語や内容の分布、合成キャプションの正確性は、結果を左右する重要な要素です。利用者には、目的に応じたフィルタリングや重複除去が求められます。LAION-BVDは、ウェブ動画を再利用可能なマルチモーダル学習資源へ変換する方法を示す、オープンな出発点と位置付けられます。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
「見る」から「行動する」へ:一人称知能プラットフォームとしてのスマートグラス
マルチモーダル
cctest.ai
マルチモーダル

「見る」から「行動する」へ:一人称知能プラットフォームとしてのスマートグラス

新たなサーベイは、スマートグラスを単なるカメラやディスプレイではなく、一人称知能の基盤として捉え直す。重要なのは、知覚から行動までのループを、現実の制約下で信頼性と制御可能性を保ちながら維持できるかどうかだ。

続きを読む
CCTest · Blog
DeepSeek、V4シリーズ初の公式ビジョン実験モデルを公開
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek、V4シリーズ初の公式ビジョン実験モデルを公開

DeepSeekはAPIプラットフォームでdeepseek-v4-flash-vision-expを公開し、V4シリーズとして初めて公式に画像入力へ対応した。ツール利用やコーディングAgent関連の評価でも、複数の指標が向上している。

続きを読む
CCTest · Blog
DeepSeek V4-Flashに視覚機能、マルチモーダルAgentへ前進
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek V4-Flashに視覚機能、マルチモーダルAgentへ前進

DeepSeekは、V4-Flashに視覚機能を加えた実験版「DeepSeek-V4-Flash-Vision-Exp」を公開しました。指定されたモデルIDを通じてAPIから利用でき、テキスト能力を維持したまま画像理解を強化する位置付けです。

続きを読む