返回文章列表
视觉与视频

Gemini推出Agentic Video Understanding:让模型自己决定“看哪里”

阅读约 3 分钟

长视频理解一直面临一个两难:模型看得越细,Token和推理成本越高;采样过于稀疏,又容易错过快速动作、短暂变化或关键语句。Google DeepMind此次推出的Agentic Video Understanding,试图把视频分析从“按固定帧率通读”改成“围绕目标主动检索”。

核心变化:从静态采样到主动观察

传统处理方式通常以固定帧率读取视频,默认每秒1帧,开发者也可以通过API调整。这种方法实现简单,但对长视频并不经济:整段视频可能包含大量与问题无关的画面,同时快速发生的事件可能恰好落在采样间隔之间。

Agentic Video Understanding则允许Gemini根据任务决定:先查看哪些时间段、使用多高的帧率,以及应该调用画面、音频还是字幕。模型会通过一个内部工具反复加载相关片段,先粗略定位,再对候选时间窗口进行更高密度的检查。开发者过去需要自行搭建这类检索和重采样流程,现在可以把部分控制权交给模型。

官方披露的效果与适用任务

Google表示,在标准视频理解基准上,开启该能力后,支持的Gemini模型最多可减少88%的Token消耗、降低66%的分析成本,并带来最高7%的准确率提升。具体收益会随模型、视频长度和任务类型变化,不能简单理解为所有场景都能达到同样结果。

它尤其适合以下工作:

  • 亚秒级时刻检索:定位状态变化、镜头切换或剪辑边界,服务于自动化视频编辑。
  • 长视频问答:在数十分钟、数小时的讲座、教程或会议中寻找“针尖信息”。
  • 异常检测:发现疑似异常后提高对应时间段的采样密度,检查细微视觉瑕疵。
  • 动作与目标计数:针对快速重复动作或视频中的独立物体进行更精确的追踪。

对开发者和产品的意义

这项更新的重点不只是省Token,而是把视频理解中的“观察策略”纳入模型推理。对于开发者而言,长视频应用可以减少手写分段、重采样和多模态信号调度逻辑;对于模型而言,视频不再只是一次性输入,而更像一个可以按需查询的时间序列数据库。

目前该能力已通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform提供,覆盖Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite。启用方式是在配置中将处理模式设为“agentic”,且官方表示不收取额外功能费用,仍按标准API Token价格计费。

Google还计划将相关效率和质量改进带到Gemini应用,并在未来几个月用于YouTube视频页面的Ask YouTube。若后续上线范围和效果符合预期,视频问答可能从“总结整段内容”进一步转向“根据问题主动寻找证据”。不过,官方数据来自基准测试和早期使用,实际表现仍会受到视频类型、问题设计、音频质量及模型选择影响。

来源:Google DeepMind

评论

正在确认登录状态……

正在加载评论……

相关文章