李飞飞团队发布 Atlas:从一张图补全可交互的三维世界
导语
李飞飞创办的 World Labs 发布了名为 Atlas 的新一代世界模型。根据公开介绍,Atlas的目标并不只是生成一段看起来连贯的视频,而是理解场景的空间结构、时间变化以及相机如何在其中移动。用户可以从一张或多张图片出发,让模型补全一个可从不同视角观察的三维世界。
核心能力
- 受控相机生成:模型能够根据输入图片生成具有像素级相机控制的图像和视频,最高支持输出1分钟、1440p视频。相机轨迹越复杂,其与现有视频模型的差异越可能显现。
- 稀疏视角重建:Atlas可以利用一张到数十张图片重建真实场景,既生成新视角帧,也输出显式的3D表示。素材称,其效果超过当前专门进行3D重建训练的开源模型。
- 时空建模:输入视频后,模型可同时处理空间和时间信息,用于改变观察视角、制作视觉效果,也可服务于机器人 Real-to-Sim 流程。
- 多模态生成:除图像和视频外,Atlas还支持文本生成图片与360度全景图,并能处理相机位姿、深度图等数据。
技术路线
Atlas采用多模态自回归扩散Transformer。文本、图像、视频、深度图和相机位姿会被组织成带有三维位置的序列,形成统一的空间上下文;模型再依据上下文逐步生成后续内容。自回归机制提供了灵活的任务编排方式,扩散过程则负责生成高维连续的图像与视频数据。World Labs还提到,模型从设计上兼容KV Cache、扩散蒸馏等规模化和推理优化技术。
对机器人意味着什么
Atlas最值得关注的方向可能是具身智能。机器人训练通常需要大量可控、低成本且覆盖多种情况的数据。若只提供几张真实环境照片,模型就能生成相应的RGB与深度数据,并构建可变化的模拟空间,那么真实世界到仿真环境之间的转换就会更顺畅。结合World Labs此前对“模拟器”价值的强调,以及其公开的 Real-to-Sim-to-Real 方向,Atlas显然承担着连接视觉建模与机器人训练基础设施的角色。
不过,世界模型生成的几何结构、深度和动态是否足够可靠,仍需要在更多任务中验证。当前Atlas仅向部分合作伙伴开放早期访问,公开材料也主要集中在相机控制生成和3D重建评测。它展示了统一空间上下文的路线潜力,但距离稳定、通用的物理模拟器仍有现实差距。
来源:量子位
评论
正在确认登录状态……
正在加载评论……