返回文章列表
世界模型

GAE:让生成模型在几何原生潜空间中构建更一致的3D世界

阅读约 2 分钟

导语

当前的视频生成模型可以合成逼真的单帧画面,却不一定理解画面背后的三维场景。镜头移动时,物体形状、空间关系和相机运动可能逐渐漂移。GAE(Geometry-Native Autoencoder,几何原生自动编码器)提出的切入点是:问题不只是生成器能力不足,也可能是生成模型使用的潜空间过于偏向外观。

核心要点

  • 把几何放进潜空间。 传统视觉生成模型通常在以纹理、颜色和局部外观为主的表示中建模。GAE则借助几何基础模型的特征,将跨视角结构和语义信息重新参数化为紧凑潜变量。
  • 一个状态,多种解码结果。 GAE的潜表示可以联合解码为RGB图像、深度、相机信息和三维点图。换言之,模型生成的不是彼此独立的画面,而是一个能够对应多种观测的统一场景状态。
  • 兼容标准条件生成框架。 在该几何原生表示之上,研究者使用条件流模型进行生成,并以相机轨迹作为条件,让视频生成过程显式关联摄像机运动与场景几何。
  • 几何一致性获得独立评估。 在保持生成器和训练协议不变的受控比较中,替换潜空间后,RealEstate10K上的FVD下降12.7%,DL3DV上下降23.1%;RealEstate10K上的相机轨迹误差则降低约一半。

意义与影响

这项工作的重点并不是给现有生成模型增加一个“深度输出头”,而是重新思考生成模型应该在哪种表示中工作。若潜变量本身已经编码了跨视角几何,生成器就有机会在合成外观的同时维持更稳定的空间关系。GAE因此可以被视为连接感知与生成的接口:感知模型提供几何结构,生成模型则在这一结构化空间中完成多样化合成。

这一思路对世界模型、可控视频生成和新视角合成具有启发意义。未来的关键问题包括:几何原生潜空间能否扩展到更复杂、更长时序的场景;联合解码是否会牺牲纹理细节或生成多样性;以及在真实部署中,几何一致性指标能否更好地反映用户对视频质量的感受。就现有结果而言,GAE说明潜空间并非生成系统的隐蔽工程细节,而可能是决定三维一致性的核心设计选择。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
给世界模型补上“物体恒存”:WROP如何训练视频模型理解遮挡与连续性
世界模型
cctest.ai
世界模型

给世界模型补上“物体恒存”:WROP如何训练视频模型理解遮挡与连续性

一项新研究把认知科学中的物体恒存任务引入视频生成模型训练,推出包含150类任务、150万样本的数据基础设施WROP。实验显示,经过训练的16B模型在连续生成模型中排名第一,但这仍主要反映特定测试集上的能力。

阅读全文
CCTest · Blog
HappyWorld-Bench:从“看起来真实”到“交互可靠”的世界模型评测
世界模型
cctest.ai
世界模型

HappyWorld-Bench:从“看起来真实”到“交互可靠”的世界模型评测

HappyWorld-Bench提出了一套覆盖视频、空间与具身系统的统一评测框架,重点检验世界模型在探索、交互和修改后的状态一致性与行为响应能力。结果显示,当前系统仍普遍存在长期一致性不足、编辑执行偏差和多步状态保持困难。

阅读全文