返回文章列表
AI 智能体

Video-DeepResearch:把深度研究代理带进视频流时代

阅读约 2 分钟

导语

把多模态代理从“看图问答”推进到“看视频做深度研究”,并不是简单增加输入长度,而是要让模型真正学会在时间维度上追踪线索、跨帧验证事实,再决定何时调用外部搜索工具。Video-DeepResearch(Video-DR)讨论的正是这个问题。

核心要点

  • 先看后搜,抑制模态偏置:作者采用感知与探索解耦的流程,并通过分阶段工具解锁,强制模型先完成视觉 grounding,再进入网页检索。
  • 减少“记忆代答”:在视频问答中,模型容易直接调用内部参数知识,而不是依赖真实工具链。Video-DR通过视频驱动的数据与任务设计,尽量让捷径失效。
  • SFT + GRPO 两阶段训练:先用监督微调建立基本行为,再用 Group Relative Policy Optimization 继续优化,使模型能自己发现更有效的工具使用策略,而不只是模仿示范。
  • 自建 Video-DR-Bench:论文构建了一个包含 200 个复杂多跳 VQA 任务的人机协同基准,用来检验代理是否真的具备跨帧、跨步骤的研究能力。
  • 结果具有可比性:文中给出的 Video-DeepResearch-35B-A3B 达到 64.0% 平均准确率,30B-A3B 版本为 59.3%,显示该训练范式在不同规模下都能工作。

这项工作的意义

Video-DR 的价值,不只在于“视频任务分数更高”,更在于它提出了一种面向视频流的代理范式:研究代理不应在一开始就把搜索当作默认答案,而应先用视觉证据建立事实基础,再决定是否上网补充信息。这个思路对长视频理解、视觉检索、复杂多跳问答都很有启发。

从更广的角度看,这篇工作也在提醒行业:真正有用的多模态代理,能力边界不只是模型参数有多大,还包括它是否能被训练成“会用工具、按步骤验证、减少投机”的系统。Video-DR 试图突破的,正是模仿学习带来的行为上限。

来源

Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章