返回文章列表
世界模型

NVIDIA Cosmos 3 Edge 发布:把世界模型推向边缘设备

阅读约 3 分钟

导语

NVIDIA 将 Cosmos 3 Edge 发布到 Hugging Face 的 Cosmos 3 仓库中,核心目标很明确:让机器人和视觉 AI 系统不必完全依赖数据中心,也能在边缘设备上理解环境、推演变化,并生成可执行动作。对于工厂、仓储、医院等真实场景中的物理 AI 来说,这类能力关系到系统能否在低时延、受限内存和现场部署条件下稳定运行。

Cosmos 3 Edge 是一个 40 亿参数的开放世界模型。按照 NVIDIA 的介绍,它既可以作为小型视觉语言模型使用,用于视觉分析和实时推理,也可以经过后训练成为世界动作模型,在机器人控制分辨率下处理观测并输出动作。

核心要点

  • 面向边缘的世界模型:模型支持在 NVIDIA RTX PRO、DGX、GeForce RTX 以及 Jetson 等硬件上运行,重点不是单纯追求规模,而是在受限设备上取得较高吞吐与可用精度。
  • 理解、预测与动作被放进同一框架:世界模型需要理解当前场景、预测接下来可能发生什么,并判断动作会如何改变环境。Cosmos 3 Edge 将这些能力整合到共享表示中。
  • 双 Transformer 塔结构:模型包含自回归塔和扩散塔。前者处理视觉与文本 token,用于理解和推理;后者处理视觉、音频和动作 token,用于预测、生成与神经仿真。两者共享多模态注意力层,但保留各自的归一化层和 MLP。
  • 统一动作表示:不同实体的动作形式并不一样,例如车辆、相机、机械臂和夹爪都有不同控制变量。Cosmos 3 将平移、旋转和操作状态编码为紧凑几何向量,使视觉变化与物理控制之间建立联系。
  • 可作为机器人策略模型:在策略模式下,模型可以同时预测下一步动作及其视觉后果。NVIDIA 还发布了基于 DROID 数据集后训练的 Cosmos 3 Edge Policy,用于抓取和放置任务。
  • 开放后训练路径:除基础模型外,NVIDIA 还提供参考后训练 checkpoint 与训练脚本,帮助开发者将模型适配到特定机器人策略或视觉生成任务中。

意义与影响

Cosmos 3 Edge 的重点不只是“又一个多模态模型”,而是把世界建模、视频/动作生成和机器人策略训练放到更靠近传感器的位置。对物理 AI 来说,边缘部署意味着更低延迟、更强隐私控制,也减少了对持续云端连接的依赖。

从技术方向看,模型采用共享表示连接语言、视觉、音频和动作,体现了机器人基础模型的一个趋势:系统不再只识别图像或输出文本,而是需要理解因果、运动和控制之间的关系。它生成的视频预测也不只是画面补全,而应反映动作对环境的影响。

当然,素材主要来自 NVIDIA 官方博客,仍带有明显发布和推广性质。实际效果还取决于开发者的后训练数据质量、部署硬件、控制闭环设计以及真实机器人环境中的鲁棒性。即便如此,Cosmos 3 Edge 仍提供了一个值得关注的开放起点:开发者可以在 Hugging Face 获取模型,并围绕机器人、智能基础设施和视觉 AI 场景构建定制化世界模型。

来源:Hugging Face Blog

评论

正在确认登录状态……

正在加载评论……

相关文章