UniWorld-View登顶WorldScore:国产世界模型如何从一张图生成可控新视角视频
导语
世界模型赛道又出现一个值得关注的国产开源项目。兔展智能联合北京大学、鹏城实验室研发的 UniWorld-View 登上李飞飞团队 WorldScore 榜单首位。它主打的能力很直观:输入一张图,或一段随手拍的单目视频,再给定相机轨迹,就能生成推、拉、摇、移,甚至环绕场景的新视角视频。
更重要的是,UniWorld-View 试图用同一套模型和代码覆盖单图 3D 生成与视频 4D 生成,并已适配国产昇腾算力,代码和权重也对外开源。
核心要点
- 解决大基线新视角合成难题:传统 NeRF、3DGS 更依赖多视角输入,单目视频视角覆盖不足时容易出现空洞和伪影;纯生成式方法又常因缺少显式几何约束,在大角度转动时失控。
- 引入遮挡感知点云渲染:UniWorld-View 先用几何方式生成目标视角条件图,但针对点云渲染常见的前景背景撕裂和背面漏光做了处理。
- 双重投影处理遮挡区域:系统将源图投影到目标视角,再反向投影回来,找出无法可靠对应的像素,并在渲染中以 mask 标记,避免错误纹理误导扩散模型。
- 法向过滤减少“透视穿帮”:通过估计点的法向量,过滤背对相机的点,降低绕到物体背面时仍看到正面纹理的情况。
- 双流条件注入兼顾结构与外观:几何流负责目标视角的空间约束,外观流通过 Ref-DiT 模块从源视频中检索可用纹理和细节,让生成结果既对齐相机位姿,也尽量保持原始内容一致。
- 从新视角视频延伸到 4D 重建:模型先在第一帧生成静态环绕视图作为外观锚点,再在固定机位生成同步多视角视频,最后交给 4DGS 优化,形成可自由视角浏览的动态场景。
意义与影响
UniWorld-View 的价值不只是“把图变成视频”。它把几何约束和生成模型结合得更紧:该留洞的地方不硬补错误纹理,该过滤的背面点不强行渲染,再由扩散模型完成合理补全。这类路线有望降低单目素材进入 3D/4D 内容生产的门槛。
从产业角度看,可控新视角生成对影视预演、游戏资产、商品展示、空间漫游和设计工作流都有潜在意义。开源代码与权重也会让研究者更容易复现实验、比较方法,并推动国产视觉世界模型生态继续积累。
不过,榜单领先并不等同于所有真实场景都已解决。大幅度视角变化、复杂动态遮挡、细小结构一致性等仍可能是后续检验重点。UniWorld-View 更像是把“单目输入到可控 4D 场景”这条路径往前推进了一步。
来源:量子位
评论
正在确认登录状态……
正在加载评论……