让代码负责世界演化:Code World Model 把编码智能体变成“世界大脑”
阅读约 2 分钟
导语
视频世界模型通常从连续画面中学习环境如何变化,但画面更多呈现“结果”,不一定包含支撑结果的规则、知识和因果机制。例如,一个物体为什么会移动、某次操作如何影响后续状态,单靠像素序列并不容易长期记住。Code World Model(CWM)提出了一条不同路径:让代码承担世界演化,让视频模型承担视觉实现。
核心要点
- 编码智能体充当世界大脑。 语言模型根据事件和用户操作进行推理,并生成可执行代码,维护世界状态、更新对象属性以及处理事件后果。这样,世界的变化不只依赖下一帧画面,而是由显式状态和规则推动。
- 演化与渲染相互解耦。 CWM 不要求负责逻辑的模型直接生成高保真视频。编码侧先完成状态更新,再将结果交给视觉侧,从而把“世界应该怎样变化”和“变化后看起来怎样”分成两个环节。
- 代理表示连接代码和视频。 研究者设计了一种代理表示,用逐帧的时空约束描述可执行世界中的对象、位置和运动等信息,并将其编译成代理视频。视频模型以此为条件,生成更具视觉细节的观察结果。
- 训练数据来自对齐过程。 团队构建了从游戏过程和真实世界视频中生成代理—观察配对数据的流程。在配对游戏数据上微调后,MiniMax-H3 能够跟随由编码智能体搭建的简单交互世界中的时空规格,同时保留丰富的画面细节和动态表现。
意义与影响
CWM 的核心价值不在于让视频模型单独承担更多推理,而在于重新划分世界模型的职责:代码负责可检查、可持续的状态变化,生成模型负责灵活、逼真的视觉表达。对于需要长期后果、规则一致性和开放式演化的交互环境,这种架构提供了比纯视频预测更清晰的控制接口,也更便于修改世界规则或追踪状态变化。
不过,现有结果主要展示在由编码智能体构建的简单交互世界和配对游戏数据上。代理表示能否覆盖更复杂的物理机制、社会规则与现实场景,代码生成和视频渲染之间能否始终保持一致,仍有待进一步验证。总体而言,CWM 展示了“程序化世界状态+生成式视觉观察”的组合方向,为可持续的开放世界模型提供了新的研究思路。
评论
正在确认登录状态……
正在加载评论……