返回文章列表
视觉与视频

连续视频流上的自监督学习,为何比打乱图片更难?

阅读约 3 分钟

导语

许多视觉自监督学习方法默认数据可以被自由打乱:图片独立采样,训练轮次之间反复遍历,模型不断接触分布较为多样的批次。但真实世界的感知往往更接近另一种模式——摄像头持续工作,画面按时间顺序到来,数据不能全局重排,也不应无限重复播放。论文《I Have a Stream》关注的正是这一更接近自然观看过程的训练设定。

核心要点

  • 建立连续视频流基准。 研究者构建了 WT++,包含95小时城市步行游览视频,用于测试模型在严格滑动窗口批次下的预训练能力。训练过程中,帧按时间顺序消费,不进行全局洗牌,也不采用多轮重复回放。
  • 传统方法并不适应流式输入。 对比学习和蒸馏类方法在连续视频场景中表现较差;掩码自编码器(MAE)相对稳健,但仍未达到标准独立同分布训练的水平。
  • 问题不只是相邻批次太相似。 研究首先考察了滑动窗口导致的批次间相似性,但实验表明,真正关键的障碍是批次内部的高相似度:同一批次里的连续帧往往几乎是重复画面,导致有效视觉变化不足。
  • StreamMAE调整数据管线。 新方法保留MAE的图像重建目标,同时加入面向连续数据流的正则化,并在裁剪策略中提高对运动区域的偏好,以增加训练样本中的有效变化。
  • 流式训练效果得到改善。 StreamMAE优于流式训练基线,在相同视频数据上接近 i.i.d. MAE,并且与使用ImageNet预训练的MAE保持竞争力。当预训练视频从12小时扩展到95小时,模型性能仍呈积极增长。

意义与影响

这项工作提示,数据顺序不是训练系统中的无关细节。对于视频而言,“看到了多少帧”并不等于“获得了多少信息”;如果一个批次由大量近乎重复的画面构成,名义上的数据规模可能高于实际的学习信号。研究将瓶颈从简单的批次间相关性,进一步定位到批次内部的冗余,为流式视觉学习提供了更具体的分析框架。

StreamMAE的价值也不只在于改进一个模型。它说明,在无法随意缓存、重排或重复利用数据的应用中,训练目标与输入采样策略需要协同设计。这对持续视频理解、机器人视觉、移动设备感知以及面向真实世界的长期预训练都有参考意义。与此同时,WT++和配套评测为后续研究提供了一个可复现实验起点:未来方法需要回答的,不只是能否在海量随机图片上学习表征,还包括能否在连续、冗余且不可重排的数据流中持续吸收新信息。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章