記事一覧へ戻る
AIエージェント

Video-DeepResearch:連続動画に対応する次世代マルチモーダル研究エージェント

読了目安 2 分

はじめに

Video-DeepResearch(Video-DR)は、入力が画像や文書ではなく、時間的に連続する動画である場合に、マルチモーダル研究エージェントをどう設計すべきかを問う研究です。著者らは、動画理解には単なる長文コンテキストではなく、フレームをまたぐ密な時空間 grounding が必要だと主張しています。

主なポイント

  • 視覚を先、検索を後に:感知と探索を分離し、段階的にツールを解放することで、まず動画を丁寧に確認してから外部検索に進ませます。
  • モダリティ・バイアスへの対処:現行モデルは、視覚ツールを使える状況でも文字検索へ寄りがちです。Video-DR はその近道を構造的に抑えようとしています。
  • パラメトリック知識リークの抑制:内部記憶だけで答えるのではなく、実際のツール駆動の実行を促します。
  • 二段階学習:まず SFT で基本挙動を学び、その後 GRPO でより自律的なツール使用を獲得します。
  • Video-DR-Bench を構築:200 件の複雑な多段階 VQA を含む、人間と AI の協働ベンチマークを用意しています。
  • 報告された性能:Video-DeepResearch-35B-A3B は平均 64.0% を記録し、30B-A3B 版も 59.3% に達したとされています。

意義

この研究の面白さは、動画 QA を「答えられるか」ではなく、「本当に調査エージェントとして振る舞えるか」という観点に引き上げている点です。長尺動画、証拠追跡、多段推論が必要な場面では、この違いが非常に重要になります。

今後のマルチモーダルエージェントには、単純なモデル拡大だけでなく、行動を制約し、視覚確認を先行させる設計が求められるかもしれません。Video-DR はその方向性を具体的に示した一例です。

ソース

Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Skill-α:強化学習で AI Agent のスキル生成を段階的に改善
AIエージェント
cctest.ai
AIエージェント

Skill-α:強化学習で AI Agent のスキル生成を段階的に改善

Skill-α は、Agent のスキル生成を一連の編集プロセスとして扱い、各編集が下流タスクの実行を改善するかどうかで評価する。文書由来と経験由来のスキル生成の両方で、既存のヒューリスティック型・パイプライン型手法を上回った。

続きを読む
CCTest · Blog
SKT:検証済み合成データでAIエージェントのスキル活用を訓練
AIエージェント
cctest.ai
AIエージェント

SKT:検証済み合成データでAIエージェントのスキル活用を訓練

SKTは、言語モデル型エージェントが再利用可能なスキルを選び、使い、組み合わせる力を高めるためのデータ合成パイプラインだ。生成したタスクと実行軌跡を検証し、教師あり微調整に使える高品質なデータを構築する。

続きを読む