返回文章列表
世界模型

WorldSculpt:让单物体 3D 生成先验构建拥挤世界

阅读约 3 分钟

导语

把一段真实世界视频转换成可编辑、可交互的 3D 世界,难点不只是恢复相机看到的表面,还要在物体彼此遮挡时推断不可见部分,并把场景拆分成可独立使用的对象。论文《WorldSculpt: Generating Compositional Worlds from Grounded Videos》提出了一条更偏生成式的路线:不把整个环境重建成一块整体几何,而是在统一世界坐标系中逐个生成物体网格。

核心方法

传统几何重建方法通常擅长利用观测中的真实像素,但在密集场景中,每个物体只暴露有限区域,最终容易留下破碎或不完整的几何。已有带生成先验的组合式方法,则多集中于较简单的场景,难以扩展到含有数百个物体的环境。

WorldSculpt 的关键策略,是把成熟的单物体 3D 生成先验迁移到多视角条件下。研究团队以 Pixal3D 为基础,加入能够接收多幅、带位姿观测的条件路径,让模型在生成物体完整网格时,同时受到视频中实际外观、空间位置和多个视角的约束。最终输出不是一个不可拆分的整体,而是一组处在同一世界坐标系中的对象网格。

值得注意的是,模型微调阶段完全使用规范空间中的单物体数据,没有针对整场景进行训练。论文声称,这种训练与应用之间的错位并未阻止模型处理严重遮挡的复杂环境,反而展示了单物体生成先验向大规模组合式重建扩展的可能性。

数据集与评测

研究还发布了 UE-MeshyScene,这是一个面向密集拥挤场景的照片级基准,包含数百个物体、逐物体标注以及对应的真实网格。论文在单物体、受控多物体和 UE-MeshyScene 等设置下进行评估,并报告该方法相较既有方法具有更好的表现,且场景复杂度和遮挡程度提升时优势更加明显。研究者还展示了将 Marble、HY-World 2.0 等系统生成的 3DGS 世界转换为组合式网格场景的应用方向。

意义与局限

这项工作的价值在于重新组织了“场景重建”的问题:生成模型负责补全和塑造单个物体,视频观测负责提供实例级的现实约束,世界坐标系则负责把各对象重新组合起来。若这一范式继续成熟,它可能服务于游戏资产制作、AR/VR、仿真和机器人感知等需要可编辑 3D 世界的任务。

不过,从素材能够确认的内容看,论文主要证明了方法在所述基准和示例转换任务中的可行性,并未给出所有真实环境下的泛化边界。对于相似物体区分、细小结构、材质真实性以及生成几何与视频证据之间的冲突,仍需要更多评测。WorldSculpt 更像是一个可扩展的研究起点,而不是已经解决通用世界重建的最终方案。

Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章