VLA不只靠堆数据:VLAct把表示学习放在机器人泛化之前
机器人领域正在训练越来越通用的视觉—语言—动作(VLA)模型,但它面临一个与大语言模型不同的现实约束:机器人轨迹很难规模化获取。互联网图文数据可以持续扩展,而机器人数据需要真实设备、场景和人工操作参与,采集成本高,覆盖的物理世界也相对稀疏。在这种情况下,继续收集数据并不是唯一答案,模型能否把有限轨迹转化为可迁移的表示,可能同样关键。
Hugging Face Daily Papers 收录的 VLAct,提出了一条“表示优先”的继续预训练路线。它先在广泛、异构、跨机器人本体的数据上训练面向VLA的VLM骨干,再进行具体任务的微调。该设计并非简单地让视觉语言模型拟合动作标签,而是试图同时保留原有的视觉—语言先验,并让不同机器人之间形成更具共享性的动作语义。
核心做法包括:
- 保留VLM先验:继续预训练过程中约束模型不要丢失原有的视觉与语言能力,使其不至于被有限的机器人轨迹过度“窄化”。
- 连续动作多头协同监督:使用多个动作预测头共同学习连续控制信号,帮助模型应对不同数据来源和机器人本体之间的差异。
- 部分统一动作布局:将不同本体的动作表示在一定程度上对齐,同时保留任务微调阶段使用专用动作头的灵活性。
这一设计体现了一个重要判断:跨本体迁移不一定要求所有机器人共享完全相同的控制接口,但需要在更高层面建立可复用的动作概念。换言之,模型可以理解“抓取”“移动”或“操作”的共同结构,再将其映射到具体机器人的关节和控制空间。
实验覆盖仿真、真实环境以及未见过的机器人本体。在LIBERO-Plus和RoboTwin 2.0上,VLAct的成功率分别达到82.6%和92.5%,并超过摘要中列出的工业VLA系统ABot-M0与LingBot-VLA。在RoboDojo上,它按成功率位列所有策略第六,并超过其中明确标注为世界动作模型的参赛方法。更值得关注的是,在未见的人形机器人本体RoboCasa-GR1上,VLAct仅使用20%的下游轨迹,就超过了使用完整数据训练的GR00T-N1.6基线。
这些结果不意味着数据规模不再重要,而是说明在固定数据预算下,预训练表示质量可能成为独立的性能杠杆。项目还开放了数据、模型以及完整训练和微调流程,完整继续预训练只需16张GPU。对研究者而言,这降低了复现实验和开展跨本体研究的门槛;对整个VLA领域而言,它把竞争重点从“谁拥有更多轨迹”进一步拓展到“谁能更有效地组织和共享动作知识”。
不过,现有材料主要呈现总体结果与方法概览,尚不足以据此判断各个组件的独立贡献、数据配比或在更多真实部署条件下的稳定性。VLAct更适合作为表示中心化VLA训练方向的有力信号,而不是对所有机器人任务的普遍保证。
评论
正在确认登录状态……
正在加载评论……