返回文章列表
世界模型

SolarWM:用开放数据与统一训练框架推动长时视频世界模型

阅读约 3 分钟

导语

视频世界模型的目标,不只是生成一段看起来连贯的视频,而是持续理解环境、响应动作,并在较长时间范围内保持状态与运动逻辑。要实现这一点,研究者同时面临数据来源复杂、相机信息不统一、视频生成骨干差异明显,以及训练和推理流程难以复用等问题。SolarWM的核心贡献,正是尝试把这些环节放进一套开放且可重配置的系统中。

核心要点

  • 统一多来源数据。 SolarWM将大量来自不同数据集的标准化视频片段转换为帧对齐的数据契约,覆盖视觉观测、度量相机几何、文本描述、质量元数据、筛选决策和来源记录。更重要的是,数据源处理与训练混合策略被拆开,研究者可以在不重复处理原始数据的情况下调整训练配方。
  • 适配不同视频骨干。 项目提供共享的相机条件、训练和推理接口,并在Wan2.2、LTX-2.5和MiniMax-H3基础上构建四个5B至33B规模模型。它并没有强行把所有模型改造成同一种结构,而是尽量保留各骨干的原生表示和优化目标。
  • 采用三阶段训练路线。 训练流程依次结合双向适配、教师强制的自回归初始化,以及分布匹配蒸馏。该方案旨在把非因果视频生成能力逐步转化为可交互的因果模型,同时避免依赖专门的ODE或一致性蒸馏初始化。
  • 从短片段走向长时交互。 根据项目介绍,模型只使用5秒序列进行训练,却能够进行分钟到小时范围的连续 rollout,并支持实时交互。项目还强调,这一结果不依赖长序列微调或注意力汇机制。

意义与影响

SolarWM的价值首先在于工程基础设施,而不只是某个单一模型的指标。世界模型研究往往被数据清洗、相机条件处理和模型特定代码割裂,导致不同工作的结果难以复现和比较。统一的数据契约与骨干适配层,可以降低更换数据配方、模型架构和推理设置的成本,也为后续开展消融实验提供更清晰的边界。

其次,短序列训练支持长时 rollout,为交互式模拟、具身智能和游戏环境建模提供了值得关注的技术路线。不过,分钟或小时级生成是否始终保持物理一致性、身份稳定性和可控性,仍需要结合完整论文、公开权重及更系统的评测来判断。素材中对所使用数据集数量存在“10个”和“14个”两种表述,具体数字应以正式论文或代码仓库的最终版本为准。

如果项目所承诺的数据、训练配方、模型权重和框架能够完整开放,SolarWM有望成为研究者比较不同视频骨干、数据混合策略与长时推理方法的公共起点。

Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章