可编程世界模型:让视频生成拥有持久状态与游戏规则
导语
近年来的视频世界模型越来越擅长生成逼真的动态画面,也开始支持一定程度的交互。但当交互持续更长时间,模型往往难以稳定记录物体数量、生命值、位置变化等信息,也难以严格执行用户预先设定的游戏规则。来自论文《Programmable World Model》的方案,试图从系统架构上解决这一问题:让“世界如何变化”和“画面如何呈现”分别由更适合的模块负责。
核心思路
- 用程序描述世界规则:一个智能体将自然语言指令转换为可执行程序。程序不仅描述实体拥有哪些状态,也规定实体之间如何互动,以及状态在事件发生后如何转移。
- 由引擎维护显式状态:轻量级执行引擎持续更新全局世界状态。这个状态不会因为某个实体暂时离开镜头而消失,也可以保存无法直接从画面观察到的属性。
- 通过三维中间表示连接状态与视频:研究者提出状态增强的 3D 定向包围盒(OBB),将实体的位置、姿态及相关状态编码到空间表示中。结合目标摄像机轨迹后,系统可以确定性地编译出与像素对齐的时空条件,再交给预训练视频模型生成观察画面。
- 面向可玩环境设计:由于规则和状态不再完全寄托于视频生成模型,用户可以定义预设机制、控制单个实体,并在较长的游戏过程中保持一致的世界状态。
评测与意义
论文还提出 CombatStateBench,用于检验世界模型在计数和状态保持方面的能力。根据论文摘要,该方法在该基准上取得 94% 的 Count Accuracy 和 98% 的 State Accuracy,明显优于既有交互式视频世界模型。这里的关键并不只是生成更逼真的画面,而是建立了一个可检查、可更新、可编程的状态层。
这一设计为游戏原型、交互式故事和模拟环境提供了新的实现路径:规则系统负责确定性,视频模型负责视觉表现,两者通过结构化表示衔接。它也提示,未来的世界模型可能不应只是“根据上下文续写视频”,而应同时具备类似游戏引擎的状态管理能力。
当然,素材并未提供更完整的实验设置、模型规模或开源实现细节,因此目前更适合将其视为一种架构方向,而不是对所有长期交互问题的最终解决方案。其后续价值仍取决于状态程序的可靠生成、复杂规则的执行能力,以及视觉渲染与显式状态之间能否在更多场景中保持一致。
评论
正在确认登录状态……
正在加载评论……