返回文章列表
世界模型

Zing-0.5:让生成式世界模型真正变得可玩

阅读约 2 分钟

生成式视频模型通常擅长“展示一个场景”,但要让用户持续走动、发出指令,并让世界对操作做出连贯反馈,难度要高得多。Zing-0.5 的目标正是把世界模型从可观看的片段推进到可交互、可游玩的空间。

核心要点

  • 键盘与文本统一控制:Zing-0.5 将带有幅度信息的键盘输入,与按时间对齐的文本指令放进同一序列中训练。用户可以通过键盘影响导航,也可以用文字干预正在发生的事件,而不必切换到完全不同的控制模式。
  • 面向事件的增量生成:研究团队先利用连接的多提示视频训练片段级教师模型,再通过分布匹配蒸馏,让块级因果学生模型学习更适合逐段生成的分布。其重点不是单帧画面质量,而是让事件在连续生成中更稳定地展开。
  • 实时且低成本的交互:系统结合四步生成和保留上下文的流式推理,在 832×480 分辨率下支持 24 FPS。论文估算的服务器租用成本约为每路每分钟 0.009 美元,这为部署交互式生成世界提供了较低的成本门槛。

评测与演示

在 158 个 WBench Navigation 案例中,Zing-0.5 的总分为 81.0,一致性分数为 88.5。论文还展示了联合控制场景:用户在持续导航过程中通过文本改变事件,生成无需重启即可继续。这一演示说明,文本指令在该系统中并非只能用于初始场景设定,也可以成为运行时控制信号。

意义与局限

Zing-0.5 的价值在于把“世界生成”和“世界交互”放进同一个自回归框架。对于游戏原型、可探索叙事和具身智能研究而言,键盘与自然语言的联合输入可能比单一动作接口更接近真实使用方式。事件级监督则提供了一条思路:训练世界模型时,需要关注事件之间的连续性,而不仅是局部视频质量。

不过,现有材料主要披露了模型规模、运行配置、评测结果和演示结论,尚未提供更完整的长时序失败案例、不同硬件下的性能对比或训练数据细节。因此,Zing-0.5 更适合被看作面向可玩世界的一项开放式探索,而不是已经解决长期一致性与复杂世界规则建模的最终方案。项目发布模型权重、推理代码和 Zing-SGLang 服务实现,也为后续复现和比较提供了基础。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
World in World:让冻结的视频世界模型获得更灵活的视角与时间控制
世界模型
cctest.ai
世界模型

World in World:让冻结的视频世界模型获得更灵活的视角与时间控制

World in World 提出一种无需重新训练的推理接口,将视频观测、目标视角投影、几何线索和历史生成结果统一送入冻结的视频世界模型。它试图解决视角切换、长时探索和回访一致性之间的协调难题。

阅读全文