返回文章列表
视觉与视频

Luce:让单张图片生成的 3D 资产真正支持重光照

阅读约 3 分钟

导语

从一张图片恢复 3D 物体,难点并不只是推断出大致形状。若生成结果要进入游戏、影视、工业设计或标准渲染流程,还需要同时具备可用的几何结构、材质属性和表面细节。许多图像到 3D 方法能够生成视觉上相似的对象,却未必能在改变光照后保持合理的外观,也难以直接对接基于物理的渲染流程。

论文《Luce: Relightable Gaussians for 3D Asset Generation》把重点放在这一缺口上:它试图让单张图片生成的结果不只是“从某个视角看起来像”,而是成为包含材质信息、可以重新布光的 3D 资产。

核心要点

  • 用多模态 Gaussian 统一表达资产。 Luce 将 3D 几何和 PBR 材质放进体素化的多模态 Gaussian 云中,并为不同模态配置专门的 Gaussian 原语。材质部分覆盖反照率、金属度-粗糙度以及表面法线等信息。
  • 建立材质感知的潜空间。 一个变分自编码器负责压缩上述联合表示,将几何与材质编码到统一潜空间。这样做的目标,是让生成过程不再把形状和外观视为彼此割裂的任务。
  • 从单张图片生成 3D 潜变量。 Luce 使用 rectified-flow Transformer 预测潜表示,条件输入来自预训练图像编码器的多层特征。这些特征同时保留语义上下文和更细的空间信息,有助于模型处理物体结构与局部外观。
  • 输出形式兼顾实时表示与传统管线。 解码后可以得到可重光照的 PBR Gaussian;在需要网格工作流时,还可以额外生成带纹理的网格和切线空间法线贴图。
  • 评测结果显示出较强的对齐能力。 在 Toys4K 上,论文称 Luce 相比最强基线将 FID 改善了 28%。作者还构建了一个 AI 生成图像基准,Luce 的 CLIP 图像对齐分数为 0.8519,高于最佳基线的 0.8299。论文特别强调,结果能够保留文字、标志和铭文等细节。

意义与影响

Luce 的价值在于,它把“生成一个看起来正确的 3D 物体”和“生成一个能被重新照明、重新渲染的资产”放进同一个表示框架。Gaussian 表示擅长高效表达复杂外观,而 PBR 模态则为光照变化和标准渲染提供了更明确的物理属性。两者结合,可能减少从图像生成结果到生产级资产之间的转换工作。

从方法路线看,论文并没有只依赖单一图像特征或单一输出格式,而是先通过统一潜空间关联几何与材质,再使用流式生成模型完成从图像到 3D 的映射。这种设计也为后续加入更细粒度的材质控制、不同渲染后端或网格化输出留下了空间。

当然,现有素材主要披露了方法框架和总体评测结果,尚未提供推理成本、不同物体类别上的失败案例,以及 Gaussian 与网格输出在实际生产环境中的完整对比。因此,Luce 的实际适用范围仍需要结合论文全文、代码和更广泛的测试来判断。就已公布信息而言,它代表了单图 3D 生成从“几何重建”向“可重光照资产生成”推进的一步。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SparsePR:用“分区+残差重建”加速视频生成注意力
视觉与视频
cctest.ai
视觉与视频

SparsePR:用“分区+残差重建”加速视频生成注意力

SparsePR提出一种无需再训练的稀疏注意力方案,通过响应耦合分区和探针拟合残差重建,降低视频Transformer的注意力计算成本。在四个视频生成与世界模型上,该方法以22.0%至26.0%的实际执行密度实现质量保持,并取得1.48至2.61倍端到端加速。

阅读全文