返回文章列表
视觉与视频

TimeLens2:让视频多模态模型说清“证据发生在何时”

阅读约 2 分钟

导语

很多视频多模态大模型已经能够描述一段视频里“发生了什么”,但在需要追溯证据时,仍常常停留在笼统回答:它们可以给出结论,却不一定能指出结论对应的视频时间段。TimeLens2 关注的正是这一层能力——通用视频时序定位,即让一个模型在不同长度、不同领域、不同提问方式以及第一/第三人称视角的视频中,找出支持回答的一个或多个时间区间。

这项工作来自 Hugging Face Daily Papers 收录的论文《TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs》。相比单纯提升视频问答准确率,TimeLens2 更强调“可追溯的视频证据”。

核心要点

  • 把时间证据视为区间集合:现实视频中的一个事件未必只出现一次,证据可能分散在多个片段中。TimeLens2 将输出建模为可变数量的时间区间集合,而不是固定一个片段。
  • 构建 TimeLens2-93K 数据:团队整理了 93,232 个经过验证的 grounding 实例,覆盖 23,793 个多样化视频。数据构建流程包括由字幕生成候选片段、独立定位、跨智能体共识、语义验证以及边界细化。
  • 提出 temporal Wasserstein reward:传统强化学习奖励在预测片段不重叠或区间数量不一致时,容易给出稀疏或不稳定反馈。该方法在合并后的区间支撑上计算一维 Wasserstein 距离,为不同数量区间的预测提供更密集、无需显式匹配的反馈。
  • 与 temporal IoU 互补:Wasserstein 奖励处理全局时间分布和非重叠情况,temporal IoU 则继续提供精确重叠层面的信号,两者结合更贴近多片段时序定位的目标。

意义与影响

TimeLens2 的价值不只是“找得更准”,而是推动视频 MLLM 从描述型系统走向证据型系统。对于长视频检索、视频审查、教学内容定位、运动分析、第一人称视频理解等应用,用户往往不满足于一句回答,还需要知道模型依据的是哪几秒、哪几段画面。

论文结果显示,TimeLens2-2B 在七个基准上超过所有同尺寸基线;4B 和 8B 版本达到当前先进水平。相较各自的 Qwen3-VL 骨干,2B、4B、8B 版本分别提升 14.2、13.0 和 18.1 个 mIoU 点。材料还提到,TimeLens2-4B 在所有基准上超过 Qwen3.5-397B-A17B,平均 mIoU 高出 7.5 点。

更值得关注的是方法论变化:时序定位不再被当作单一片段回归,而是被当作集合预测与集合优化问题。这更符合真实视频证据的形态,也为后续多模态模型在“可解释、可验证、可追踪”方向的发展提供了一个清晰切口。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
FlowMimic:用像素对流场把图像编辑“迁移”到视频编辑
视觉与视频
cctest.ai
视觉与视频

FlowMimic:用像素对流场把图像编辑“迁移”到视频编辑

这篇工作试图解决一个长期痛点:视频编辑数据难采、成本高、任务类型又不够丰富。FlowMimic提出一种不用掩码的生成与编辑框架,把图像编辑样本实时转成视频编辑样本,并让模型在图像与视频两种模态之间相互“模仿”。

阅读全文