記事一覧へ戻る
AIエージェント

Video-DeepResearch:連続動画に対応する次世代マルチモーダル研究エージェント

読了目安 2 分

はじめに

Video-DeepResearch(Video-DR)は、入力が画像や文書ではなく、時間的に連続する動画である場合に、マルチモーダル研究エージェントをどう設計すべきかを問う研究です。著者らは、動画理解には単なる長文コンテキストではなく、フレームをまたぐ密な時空間 grounding が必要だと主張しています。

主なポイント

  • 視覚を先、検索を後に:感知と探索を分離し、段階的にツールを解放することで、まず動画を丁寧に確認してから外部検索に進ませます。
  • モダリティ・バイアスへの対処:現行モデルは、視覚ツールを使える状況でも文字検索へ寄りがちです。Video-DR はその近道を構造的に抑えようとしています。
  • パラメトリック知識リークの抑制:内部記憶だけで答えるのではなく、実際のツール駆動の実行を促します。
  • 二段階学習:まず SFT で基本挙動を学び、その後 GRPO でより自律的なツール使用を獲得します。
  • Video-DR-Bench を構築:200 件の複雑な多段階 VQA を含む、人間と AI の協働ベンチマークを用意しています。
  • 報告された性能:Video-DeepResearch-35B-A3B は平均 64.0% を記録し、30B-A3B 版も 59.3% に達したとされています。

意義

この研究の面白さは、動画 QA を「答えられるか」ではなく、「本当に調査エージェントとして振る舞えるか」という観点に引き上げている点です。長尺動画、証拠追跡、多段推論が必要な場面では、この違いが非常に重要になります。

今後のマルチモーダルエージェントには、単純なモデル拡大だけでなく、行動を制約し、視覚確認を先行させる設計が求められるかもしれません。Video-DR はその方向性を具体的に示した一例です。

ソース

Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SoL-Pi、長時間動くコーディングエージェントのトークン消費を削減
AIエージェント
cctest.ai
AIエージェント

SoL-Pi、長時間動くコーディングエージェントのトークン消費を削減

SoL-Piは、コーディングエージェントの基盤モデルではなく、その周囲で動くharnessを自動研究ループで改善する手法です。EdgeBenchではPiに近い性能を保ちながら、トークン通信量とAPIコストを大きく削減したと報告しています。

続きを読む
CCTest · Blog
EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる
AIエージェント
cctest.ai
AIエージェント

EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる

ポップアップや読み込み遅延、移動するウィジェットは、事前に固定したGUI操作計画を簡単に崩してしまう。EvoSkill-GUIは追加学習なしで、実行結果を技能の更新につなげる「反省・修正・再利用」ループを提案する。

続きを読む
CCTest · Blog
GoogleのCC、家庭運営を支えるAIエージェントへ転換
AIエージェント
cctest.ai
AIエージェント

GoogleのCC、家庭運営を支えるAIエージェントへ転換

Googleは、家族で共有するメールや予定、タスクを整理する新しいCCをテストしている。学校行事の登録、買い物リスト、献立作成などを支援し、個人向け生産性ツールから家庭向け協働サービスへの転換を目指す。

続きを読む