記事一覧へ戻る
マルチモーダル

AV-Flamingo:長尺で複雑な動画を理解するオープン音声・映像モデル

読了目安 2 分

導入

長い動画を理解するには、単に画像を連続で見るだけでは足りません。音声、映像、時間の流れが絡み合い、重要な手がかりが何分も離れた場所に出てくることもあります。AV-Flamingo は、まさにこの長尺・複雑な音声映像理解を狙って設計されたオープンモデルです。

主なポイント

  • 実世界データを大規模に整備Audio-Visual-Skills は約 700万件の caption と QA を含み、時間的推論、組み合わせ的理解、音声と映像の横断的な関係を重視しています。
  • 段階的な学習設計:短距離の知覚から始め、徐々に長い文脈での多イベント推論へ進む 3 段階のカリキュラムを採用しています。
  • 推論の時刻整合性を改善Temporal Audio-Visual Interleaved Chain-of-Thought により、中間推論を入力中のタイムスタンプに結びつけ、どの瞬間の情報に基づいて判断したかを追いやすくしています。
  • 広いベンチマークで強い15以上の音声・映像、オムニモーダル、音声、視覚ベンチマークで、同規模のオープンモデルを明確に上回り、より大きなオープンウェイトや閉鎖型モデルと比べても競争力があります。

意義

この研究の重要性は、長動画理解に必要な要素をかなり具体的に示した点にあります。大量で現実的なデータ、段階的な学習、時間に紐づく推論という3つの設計は、動画検索、監視、コンテンツ理解、学習支援など、実務に近い場面で役立ちます。

また、オープンモデルでも長時間・多イベント・マルチモーダルな課題でかなり戦えることを示した意味は大きいです。今後は、閉鎖型APIに依存せず、開発者が自分の用途に合わせて拡張する流れを後押しする可能性があります。

出典Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Hallo4D:マルチモーダルLLMで3D/4D生成の時空間幻覚を抑える
マルチモーダル
cctest.ai
マルチモーダル

Hallo4D:マルチモーダルLLMで3D/4D生成の時空間幻覚を抑える

Hallo4Dは、3Dおよび4D生成で起こる形状のずれ、重複、時間的なちらつきを抑えるための枠組みです。基盤となる生成モデルを再学習せず、マルチモーダルLLMを一貫性の判定役として使います。

続きを読む
CCTest · Blog
KnowAct-GUIClaw:記憶とスキルで自己進化する個人向け GUI アシスタント
マルチモーダル
cctest.ai
マルチモーダル

KnowAct-GUIClaw:記憶とスキルで自己進化する個人向け GUI アシスタント

KnowAct-GUIClaw は、「Know Deeply, Act Perfectly」という考え方に基づき、OpenClaw のクロスプラットフォーム GUI 操作と自己進化機構の不足を補うことを目指す。経験に基づく記憶、自己進化するスキルライブラリ、反省プロセスを組み合わせ、実行能力を継続的に高める設計だ。

続きを読む
CCTest · Blog
Boogu-Image-0.1公開:オープンな統合マルチモーダル画像モデルの挑戦
マルチモーダル
cctest.ai
マルチモーダル

Boogu-Image-0.1公開:オープンな統合マルチモーダル画像モデルの挑戦

Boogu-Image-0.1は、画像生成、編集、高速推論、中英バイリンガル文字描画を対象とするオープンソースの統合マルチモーダルモデル群です。論文は、限られた計算資源でもデータ、学習、推論時スケーリングの工夫で閉鎖型システムに近づけると主張しています。

続きを読む