返回文章列表
视觉与视频

3DarkFusion:在黑暗中用 RGB-NIR 与 3D 神经渲染恢复彩色图像

阅读约 2 分钟

导语

低光成像一直是计算摄影和机器视觉中的难题:当环境亮度极低时,普通 RGB 传感器往往只能得到充满噪声、颜色失真严重的画面。近红外(NIR)成像能在暗光下提供更稳定的结构线索,因此近年来不少方法尝试把 NIR 与带噪 RGB 结合起来做增强。但这类方法通常依赖精心采集的训练数据,尤其是噪声图像与干净 RGB 图像之间的配对样本,一旦场景、噪声强度或设备条件变化,泛化能力就容易受限。

Hugging Face Daily Papers 收录的论文《Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark》提出了一个名为 3DarkFusion 的思路:不再把低光增强仅仅看作二维图像到图像的映射,而是把极噪 RGB 观测与 NIR 线索放入 3D 空间中,通过神经渲染式建模进行隐式融合,从而恢复更干净的 RGB 图像。

核心要点

  • 无需干净 RGB 监督:论文强调,3DarkFusion 不依赖干净 RGB 图像作为训练监督,避免了低光场景中高质量配对数据难采集的问题。
  • RGB 与 NIR 的 3D 融合:方法将带噪 RGB 与近红外信息放到三维空间中联合建模,而不是简单在二维图像层面拼接或对齐。
  • 面向严重噪声的鲁棒性:作者称该模型能在极强噪声干扰下仍有效利用 NIR 提供的结构信息,恢复更清晰的彩色结果。
  • 跨噪声水平泛化:摘要指出,该方法能够适应不同噪声强度,而不是只在特定曝光或噪声设置下有效。
  • 合成与真实数据验证:论文在合成数据和真实数据上进行了评估,并报告其表现优于已有方法。

意义与影响

这项工作的关键意义在于,把 RGB-NIR 低光成像从“依赖大量干净配对样本的监督学习”推进到更灵活的 3D-aware 神经建模范式。对实际应用来说,这可能降低夜间摄影、安防监控、机器人夜视和低照度感知系统的数据采集成本。尤其在真实世界中,获得同一场景的干净 RGB 参考图往往并不现实,而 NIR 传感器已经在不少硬件系统中可用。

当然,从摘要信息看,仍需要进一步关注其计算成本、采集设置、不同硬件间的标定需求,以及在动态场景中的表现。但作为研究方向,3DarkFusion 提供了一个有启发性的路线:利用三维一致性和 NIR 结构线索,让模型在缺少理想监督数据的情况下也能从极暗环境中恢复彩色视觉信息。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
ShallowStream:先浅层建索引,再深层理解连续视频
视觉与视频
cctest.ai
视觉与视频

ShallowStream:先浅层建索引,再深层理解连续视频

ShallowStream 将多模态大模型的浅层计算用于持续视频编码和检索索引构建,查询时再调用深层能力完成回答。在保持接近现有流式方法效果的同时,论文报告其单帧预填充延迟最高降低 52.1 倍,10 秒端到端延迟最高降低 11.9 倍。

阅读全文
CCTest · Blog
视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化
视觉与视频
cctest.ai
视觉与视频

视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化

一项发表于 arXiv 的研究提出 DM-Align,将视频生成模型的分布蒸馏与人类偏好对齐放进同一优化框架。该方法借鉴 DPO 与 GRPO,从样本分布差异中直接构造偏好梯度,以降低传统强化学习流程的计算与稳定性成本。

阅读全文