Pelican-Sim 1.0:让机器人世界模型更懂动作与视觉
导语
机器人要在真实环境中学习,通常需要大量交互数据。但直接让机器人反复试错成本高、风险也大,因此,能够根据当前视觉状态和机器人动作预测未来观测的世界模型,正逐渐成为具身智能系统的重要基础设施。Pelican-Sim 1.0 的目标,就是构建一个可适配多种机器人形态、场景和任务的通用模拟器。
核心设计
Pelican-Sim 1.0 的第一项工作是统一动作表示。研究团队将主流机器人控制信号映射到 28 维动作值空间,使同一个模型能够服务于不同设备,而不必为每一种 embodiment 单独训练一套系统。这种设计有助于降低异构机器人数据之间的接口成本,但也要求模型理解不同机械结构和控制方式带来的动力学差异。
第二项设计是动作—视觉注入。模型不只把动作向量直接拼接到视觉特征中,而是利用 URDF 和相机渲染出包含动作信息的视频,再将其作为动作与像素之间的桥梁。这样,动作对机械臂、物体和场景的潜在影响可以通过更直观的视觉形式进入模型。根据素材,在替代融合基线之上,该设计带来了 0.904 的 PSNR 提升。
第三项设计是稀疏混合专家(MoE)。不同机器人、场景和任务的动态规律并不相同,稀疏 MoE 允许模型使用不同专家处理异构动力学,同时吸收动作模态,减少视觉信息与控制信息之间的冲突。相较于稠密骨干网络,模型的 FVD 降低了 6.530。
最后,团队通过因果适配和少步蒸馏优化生成效率,将原本 35 步的模型转化为四步自回归模拟器,速度提升 5.67 倍。这一点对于策略搜索、批量数据生成和在线决策尤其关键,因为世界模型只有足够快,才可能承担大规模试验和规划任务。
实验与下游影响
该模型使用约一百万条真实与仿真轨迹进行训练。在视频预测和动作可控性方面,Pelican-Sim 相比所评估的最强基线,在 AgiBotWorld Beta、RoboMIND 和 RoboTwin 上的 PSNR 分别提升 4.636、2.080 和 10.343;在 RoboTwin 上,适配后的 EWMBench DYN 分数提升 0.426。
这些改进并不止于视频质量。RoboTwin 的下游实验显示,每个任务加入 500 条生成轨迹和 50 条示范数据后,策略成功率从 70% 提升到 93%。模型还可用于策略评估、动作选择和策略改进:跨五个检查点的策略评估 Pearson 相关系数达到 0.994,动作选择和策略改进的相对成功率增益分别为 47.7% 和 20.3%。
意义与限制
Pelican-Sim 的价值在于,它把“动作是否有效”与“未来画面会怎样变化”放进同一个可预测框架,推动世界模型从单纯的视频生成器走向面向控制的模拟器。统一动作空间、动作视频注入和快速 rollout 也为多机器人数据共享提供了可行路径。
不过,素材主要给出了基准结果和定性泛化描述,尚不足以判断模型在长时规划、真实部署安全性、极端动作以及未见机器人结构上的稳定性。未来仍需更多真实世界闭环实验,验证预测画面能否持续转化为可靠控制收益。
评论
正在确认登录状态……
正在加载评论……