返回文章列表
世界模型

ABot-World-0:单张桌面 GPU 上的实时交互世界模型

阅读约 3 分钟

导语

世界模型的关键不只是“生成像真的视频”,而是能否在用户或智能体不断输入动作时,持续给出一致、可控、低延迟的环境反馈。ABot-World-0 正是在这个方向上的一次系统化尝试:它把动作条件视频生成、长时程自回放、角色一致性和桌面级部署放在同一个框架里,目标是在单张消费级桌面 GPU 上运行可交互的无限世界 rollout。

核心要点

  • 面向闭环交互的视频世界模型:ABot-World-0 不是单纯从文本生成视频,而是以键盘等原始动作作为统一控制接口,支持场景漫游和第三人称角色交互。用户输入动作后,模型需要实时生成后续画面,从而构成“行动—观察—再行动”的闭环。
  • 多来源数据基础设施:论文强调其数据来自 AAA 游戏、仿真引擎和互联网视频,覆盖可控制世界动态的不同场景。配套的 WorldExplorer 会根据训练反馈驱动智能体采集数据,而统一流水线包含 14 项确定性质量检查、VLM 评估,以及同步的动作和文本标注。
  • 从教师模型到因果学生模型:训练上,研究团队先使用双向动作条件教师模型,再通过 teacher forcing 与 ODE distillation 逐步蒸馏到可在线生成的因果学生模型。为了解决长时间自回放中常见的误差累积和自回归漂移,论文提出 LongForcing,让学生的长 rollout 与更长视野的教师对齐。
  • 保持第三人称角色一致性:在第三人称交互中,角色外观很容易随时间漂移。ABot-World-0 引入 reference-character memory,为身份与外观提供持续参考,帮助长时间 rollout 中维持角色一致性。
  • 部署端共同优化:系统采用流式推理栈,包括轻量 VAE 解码器、高效注意力、显存感知调度和低比特 DiT 推理。按论文披露,在优化后的低比特配置下,ABot-World-0 可在单张 NVIDIA RTX 5090 上以最高 16 FPS 流式生成 720P 视频,动作到首帧延迟约 1.2 秒,峰值显存约 19GiB。

意义与影响

ABot-World-0 的价值在于,它把世界模型从离线视频演示推进到更接近“可玩、可控、可部署”的形态。相比只追求短视频质量,这类系统更关注长时程一致性、交互响应和算力可达性,这些指标对游戏原型、具身智能仿真、训练环境生成和虚拟角色应用都更关键。

当然,摘要中的结果仍主要围绕论文基准 WorldRoamBench 和扩展交互 rollout 展开,距离稳定替代真实游戏引擎或通用模拟器仍有距离。但它展示了一条清晰路线:数据闭环采集、动作条件建模、长时程蒸馏和推理工程必须同时推进,世界模型才可能从“会生成”走向“能交互”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
UniWorld-View登顶WorldScore:国产世界模型如何从一张图生成可控新视角视频
世界模型
cctest.ai
世界模型

UniWorld-View登顶WorldScore:国产世界模型如何从一张图生成可控新视角视频

兔展智能联合北大、鹏城实验室推出的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,并已开源代码与权重。它的关键看点在于:用统一模型处理单图 3D 与视频 4D 新视角生成,并强化相机位姿控制。

阅读全文