LAION-BVD:面向多模态预训练的千万小时开放视频数据集
阅读约 3 分钟
导语
视频正在成为多模态模型训练中最重要、也最难规模化获取的数据来源之一。与静态图片相比,视频同时包含画面变化、声音、时间关系和场景语义,但大规模收集、清洗、切分与标注的成本也更高。LAION-BVD 试图从开放网络中构建一个可供研究社区使用的视频资源,为视频、音频和图像统一预训练提供数据基础。
核心要点
- 规模从 URL 开始扩展。 项目从 Common Crawl 中收集了约 13 亿个具有平台特征的视频 URL,随后下载约 8000 万个视频,总时长达到 1000 万小时。需要注意的是,公开信息描述的主要是 URL 发现规模和成功下载规模,并不意味着所有网络视频都能长期稳定访问。
- 以场景而不是整段视频作为训练单元。 数据处理流程使用内容感知的场景检测,将长视频切分为更适合训练的片段。这样既能减少无关内容,也有助于模型学习动作、事件和画面变化之间的关系。
- 描述主要通过合成方式获得。 项目为视频片段生成视频描述和音频描述,使原本缺乏人工标注的开放视频具备跨模态训练信号。合成标注有利于扩大规模,但其准确性、偏差和覆盖范围仍需要在具体应用中进一步评估。
- 视频帧也能补充图像文本数据。 研究者从场景变化位置提取关键帧,将其作为图像文本训练来源。论文指出,这类帧的视觉分布不同于常见网页图片语料,说明视频并不只是图像数据的简单容器。
- 覆盖多类评测任务。 基于该数据训练的模型在视频文本和音频文本基准上取得有竞争力的表现;在图像文本检索中,场景变化帧也展现出较强效果。摘要还指出,随着训练规模或模型规模增加,性能呈现持续改善趋势。
意义与影响
LAION-BVD 的价值不只在于“更大的视频数量”,更在于它把视频、音频和关键帧放进了同一套开放数据流程中。对于无法承担商业视频数据授权和大规模处理成本的研究团队,这类资源有望降低多模态预训练的进入门槛,也为视频理解、音频文本对齐和跨模态检索提供统一实验基础。
不过,数据规模并不能自动解决数据质量问题。视频来源的版权状态、可访问性、语言和内容分布,以及合成描述可能带来的错误,都将影响模型训练结果。后续使用者仍需要根据任务进行去重、过滤和质量控制。整体来看,LAION-BVD 更像是一个开放的基础设施起点:它展示了如何把网络视频转化为可训练的多模态样本,也将数据治理和评测透明度推到了更重要的位置。
评论
正在确认登录状态……
正在加载评论……