InfiniSplat:让单张图片生成的 3D 高斯更贴近真实表面
导语
从一张照片生成可自由观看的三维场景,一直是新视角合成和 3D 表示学习的重要目标。3D Gaussian Splatting(3DGS)凭借高效渲染和较好的视觉质量,已经成为该方向的热门表示方式。但传统 3DGS 往往依赖多视角输入和针对单个场景的优化;而单图前馈式 3DGS 则希望跳过这些成本,直接从一张图预测出可渲染的三维表示。
InfiniSplat 针对的正是这个更困难的问题:只给一张图,如何在大幅度视角变化下仍保持场景结构连贯?这项工作已被 ACM Transactions on Graphics(SIGGRAPH Asia 2026 Journal Track)接收,并在 Hugging Face Daily Papers 上发布。
核心要点
-
问题:像素对齐的高斯表示不够“贴表面”
许多单图前馈式 3DGS 方法会从固定图像网格位置预测高斯原语。这样做在近邻视角下可能有效,但当相机移动幅度变大时,高斯与真实场景表面的耦合较弱,容易出现结构不连续、原语分散等问题。 -
方法:从像素对齐转向表面对齐
InfiniSplat 的关键思路是让高斯的支持位置更多受几何结构约束,而不是机械地依附于像素中心。它首先利用深度诱导的局部表面信息进行几何引导采样,确定二维支持点的位置。 -
隐式高斯解码:按查询位置预测属性
在获得这些支持点后,模型会查询对应的图像特征,并通过一个 query-conditioned implicit decoder 预测高斯属性。也就是说,高斯预测被从固定像素格点中解耦出来,模型可以根据支持点及其特征生成更合理的三维布局。 -
目标:改善大基线新视角合成
论文摘要称,InfiniSplat 在多个跨数据集 NVS 评测中,相比单图前馈式基线取得了当前最优表现,并展示了从 Hypersim 室内合成训练到复杂开放世界场景的零样泛化能力。
意义与影响
InfiniSplat 的价值不只在于提升单图新视角合成效果,更在于指出了一个表示层面的瓶颈:如果高斯原语始终被固定在图像网格上,模型很难真正学到与场景表面一致的三维结构。通过几何引导采样和隐式解码,InfiniSplat 让前馈式 3DGS 更接近“表面驱动”的建模方式。
这对 AR/VR、空间内容生成、照片三维化和开放场景重建都有潜在意义。单图输入降低了采集门槛,前馈推理避免了逐场景优化成本,而更稳定的大视角合成则决定了它能否从演示走向实际应用。当然,素材中并未给出具体指标细节,最终效果仍需结合论文、代码和在线 Demo 进一步验证。
评论
正在确认登录状态……
正在加载评论……