小米发布 Xiaomi-Robotics-1:用 10 万小时真实轨迹扩展机器人 VLA 模型
导语
机器人学习长期面临一个尴尬现实:语言和视觉模型可以依靠互联网级数据持续扩展,但机器人操作数据昂贵、采集慢、场景有限。Xiaomi-Robotics-1 的重点不是提出一个单点技巧,而是系统性验证:如果给机器人 VLA(Vision-Language-Action)模型足够多的真实世界操作轨迹,它是否也会像大语言模型一样从规模中受益。
这篇工作给出的答案相当明确。团队用超过 10 万小时真实 UMI 操作轨迹进行预训练,覆盖 1700 多个场景,包括家庭、商业空间、工业现场和户外环境。随后再用真实机器人数据和自然语言指令进行对齐,使模型能够迁移到移动操作任务中。
核心要点
- 预训练数据规模显著扩大:模型使用超过 10 万小时真实操作轨迹,而不是只依赖特定机器人采集的数据。这类“embodiment-free”数据让模型先学习更广泛的物体交互和状态变化。
- 自动标注降低语言监督成本:团队将长轨迹切成短片段,再用视觉语言模型描述夹爪和物体在片段中的变化,把原始视频与动作数据转化为“视觉观察—语言目标—动作”的训练样本。
- 两阶段训练路线清晰:第一阶段学习通用动作生成能力;第二阶段使用跨形态机器人数据和超过 7200 小时室内真实机器人数据做对齐,并让模型适应人类常用的命令式语言。
- 规模效应可迁移到真实机器人:实验显示,增加预训练数据或模型规模会降低动作预测误差;更强的预训练模型在后训练后也能带来更好的真实机器人零样本表现,且尚未看到明显饱和。
- 少量数据微调表现突出:在手机打包、打印机补料、装洗衣物、装箱等真实任务中,平均每项少于 10 小时演示数据时,整体成功率达到 75%,对比 π0.5 的 40%;当数据增至平均每项少于 40 小时时,成功率达到 85%。
- 仿真基准结果强劲:在 RoboCasa、RoboCasa365、VLABench、RoboDojo 上分别达到 74.5%、57.4%、59.1%、13.93% 平均成功率,素材称其为四个基准上的最佳已报告表现。
意义与影响
Xiaomi-Robotics-1 的价值在于,它把机器人基础模型的竞争焦点推向了数据工程和训练范式。过去许多机器人策略受限于单一平台、单一实验室环境和小规模演示;这项工作则证明,大量非特定机器人形态的真实操作轨迹,经过语言化标注后,可以成为通用机器人策略的有效底座。
不过,这并不意味着通用家用机器人已经到来。真实世界任务仍然存在安全、长时序规划、失败恢复、硬件可靠性和评测一致性等挑战。更重要的是,论文展示的是强扩展趋势和多项任务表现,而非完全解决开放环境中的所有操作问题。
即便如此,它仍是机器人学习规模化路线中的重要信号:未来的进展可能不只来自更灵巧的机械臂,也来自更大规模、更可迁移、更容易自动标注的真实交互数据。
评论
正在确认登录状态……
正在加载评论……