WorldGuide:让视频世界模型从“生成画面”走向“执行任务”
导语
视频生成模型已经能够合成具有连续性的视觉轨迹,但“看起来合理”并不等于“完成了任务”。在整理物品、操作工具或执行一系列程序化步骤时,模型不仅要生成下一段画面,还要判断当前进度、选择下一步动作,并确认目标是否已经达成。WorldGuide 的核心尝试,是把视频世界模型从开放式预测器改造成面向目标的闭环执行系统。
核心方法:规划、执行与反馈形成循环
WorldGuide 接收一张初始图像和一个任务目标。首先,ContextPlanner 根据当前生成状态预测一个原子动作,也可以输出代表任务完成的终止标记;随后,Executor 将该动作渲染为一段视频片段。系统再读取生成结果,决定是继续规划下一步,还是结束整个流程。
这一设计针对的是开放式生成的关键缺陷:模型一旦预先确定完整轨迹,就很难对执行偏差作出反应。WorldGuide 不要求一次性给出完整计划,而是让每一步的视觉结果成为下一步决策的依据。规划器和执行器还使用同一批分步程序示范进行训练,缩小“知道该做什么”和“真正生成对应动作”之间的落差。
长流程执行的另一个难点是上下文成本。若系统保留全部历史视频,输入会快速膨胀。WorldGuide 使用层级视觉记忆,在保留任务状态的同时限制历史令牌开销,从而支持更长的执行链条。为解决训练数据不足的问题,研究团队构建了 WorldGuide Bench,包含约 5.9 万段带步骤标注的视频,覆盖 245 个任务和 27 类程序化场景,为联合训练规划器与执行器提供了基础。
结果与解读
在 WorldGuide Bench 上,WorldGuide 的任务成功率为 33.33%,高于获得参考动作计划的 MiniMax-H3(29.90%)。在 Video-CraftBench 上,WorldGuide 达到 47.69%,而仅使用目标条件时的结果为 32.73%。这些数字表明,显式的逐步规划、动作实现和视觉反馈,确实有助于提升长时程视频任务的完成能力。
不过,成功率仍未达到足以支撑可靠自动执行的水平。视频中出现了正确的局部动作,并不代表状态始终准确,也不代表最终目标一定完成。因此,这项工作更重要的价值在于提出一种可检验的系统范式:世界模型不只是预测未来画面,还应持续评估自身生成的状态,并据此修正行为。
意义与影响
WorldGuide 连接了视频生成、视觉规划和具身智能中的执行问题。其闭环框架可为未来的机器人模拟、交互式环境建模和程序化内容生成提供参考。下一步的关键仍在于提高状态验证、失败恢复和跨任务泛化能力,并建立更严格的执行可靠性评估。
评论
正在确认登录状态……
正在加载评论……