返回文章列表
视觉与视频

VideoCoCo:把 Blender 代码变成视频生成的“过程思维链”

阅读约 2 分钟

导语

文本到视频模型的画面质量正在快速提升,但“看起来真实”和“运动规律可信”仍是两件事。一个简短提示词往往只能描述结果或意图,却很难完整交代物体如何受力、如何移动、何时碰撞、怎样随时间演化。VideoCoCo 关注的正是这一缺口:让视频生成不再只从文本中隐式猜测动态过程,而是先写出一段可执行的物理与场景程序。

这篇论文提出的关键概念是 Code-as-CoT,也就是把代码作为过程级链式思维。不同于传统 CoT 只输出文字推理,VideoCoCo 让智能体生成 Blender 代码,用程序明确描述场景布局、物体属性和时间变化,再通过渲染或模拟得到确定性的时空草稿,最后交给生成式视频引擎进行写实化编辑。

核心要点

  • 双引擎分工:系统由“代码/模拟引擎”和“视频生成引擎”组成。前者负责可检查、可执行的动态过程,后者负责把相对粗糙的草稿转换为高质量视频。
  • 可执行的过程表示:相比只给关键帧、轨迹提示或文字规划,Blender 程序可以连续地规定场景在时间维度上的变化,减少视频模型自行脑补物理过程的空间。
  • 确定性时空草稿:运行代码后得到的草稿具有明确的时间结构,可作为视频编辑模型的条件输入,帮助生成结果保持更稳定的物理一致性。
  • 专门的数据适配:作者构建了 VideoCoCo-3K,这是由草稿、指令和目标视频组成的三元组数据集,用于训练或适配视频编辑器理解模拟草稿。
  • 基准表现提升:论文报告称,VideoCoCo 将 OmniWeaving 基线在 PhyGenBench 上从 0.475 提升到 0.558,在 VBench-2.0 上从 52.18 提升到 77.88,并在两个基准的平均分上取得最佳结果。

意义与影响

VideoCoCo 的价值不只在于“视频更像真的”,还在于它把视频生成拆成了两个更容易管理的阶段:先解决过程逻辑,再解决视觉质感。代码天然具备可执行、可调试、可复现和可检查的特性,因此比纯文本推理更适合表达复杂的时空关系。

这一路线也提示了视频生成研究的一个方向:未来的模型可能不只是像素采样器,而会更多借助仿真、程序化世界建模和智能体规划来组织动态世界。当然,Blender 草稿与真实世界物理之间仍有差距,代码生成的可靠性、场景复杂度扩展以及编辑器对草稿的忠实度,都会影响最终效果。但 VideoCoCo 展示了一种清晰的工程范式:让机器先“搭建并运行一个世界”,再把这个世界拍成视频。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
O-VAD:让工业视频异常检测从“看整段视频”转向“盯住每个物体”
视觉与视频
cctest.ai
视觉与视频

O-VAD:让工业视频异常检测从“看整段视频”转向“盯住每个物体”

O-VAD 提出一种免训练的工业视频异常检测框架,通过对象级分割、跟踪与状态轨迹推理,定位生产流程中的异常物体与异常过程。其核心观点是:前沿视觉语言模型在工业场景失灵,往往不是不会推理,而是缺少足够细的对象证据。

阅读全文
CCTest · Blog
让生成视频“记得来过”:无需训练的自回归渲染一致性方法
视觉与视频
cctest.ai
视觉与视频

让生成视频“记得来过”:无需训练的自回归渲染一致性方法

这篇论文关注条件视频生成在 3D 场景长程渲染中的一个关键痛点:镜头回到同一地点时,外观常常被重新生成得不一致。作者提出一种无需后训练的“闭环记忆”机制,利用 3D 引擎已有的位姿、深度与重投影信息提升重访一致性。

阅读全文