VideoCoCo:把 Blender 代码变成视频生成的“过程思维链”
导语
文本到视频模型的画面质量正在快速提升,但“看起来真实”和“运动规律可信”仍是两件事。一个简短提示词往往只能描述结果或意图,却很难完整交代物体如何受力、如何移动、何时碰撞、怎样随时间演化。VideoCoCo 关注的正是这一缺口:让视频生成不再只从文本中隐式猜测动态过程,而是先写出一段可执行的物理与场景程序。
这篇论文提出的关键概念是 Code-as-CoT,也就是把代码作为过程级链式思维。不同于传统 CoT 只输出文字推理,VideoCoCo 让智能体生成 Blender 代码,用程序明确描述场景布局、物体属性和时间变化,再通过渲染或模拟得到确定性的时空草稿,最后交给生成式视频引擎进行写实化编辑。
核心要点
- 双引擎分工:系统由“代码/模拟引擎”和“视频生成引擎”组成。前者负责可检查、可执行的动态过程,后者负责把相对粗糙的草稿转换为高质量视频。
- 可执行的过程表示:相比只给关键帧、轨迹提示或文字规划,Blender 程序可以连续地规定场景在时间维度上的变化,减少视频模型自行脑补物理过程的空间。
- 确定性时空草稿:运行代码后得到的草稿具有明确的时间结构,可作为视频编辑模型的条件输入,帮助生成结果保持更稳定的物理一致性。
- 专门的数据适配:作者构建了 VideoCoCo-3K,这是由草稿、指令和目标视频组成的三元组数据集,用于训练或适配视频编辑器理解模拟草稿。
- 基准表现提升:论文报告称,VideoCoCo 将 OmniWeaving 基线在 PhyGenBench 上从 0.475 提升到 0.558,在 VBench-2.0 上从 52.18 提升到 77.88,并在两个基准的平均分上取得最佳结果。
意义与影响
VideoCoCo 的价值不只在于“视频更像真的”,还在于它把视频生成拆成了两个更容易管理的阶段:先解决过程逻辑,再解决视觉质感。代码天然具备可执行、可调试、可复现和可检查的特性,因此比纯文本推理更适合表达复杂的时空关系。
这一路线也提示了视频生成研究的一个方向:未来的模型可能不只是像素采样器,而会更多借助仿真、程序化世界建模和智能体规划来组织动态世界。当然,Blender 草稿与真实世界物理之间仍有差距,代码生成的可靠性、场景复杂度扩展以及编辑器对草稿的忠实度,都会影响最终效果。但 VideoCoCo 展示了一种清晰的工程范式:让机器先“搭建并运行一个世界”,再把这个世界拍成视频。
评论
正在确认登录状态……
正在加载评论……