τ₀-VLA:让机器人在行动前比较可能的未来
长程机器人操作的难点,不只是把一个动作做对,还要把十几个动作按照正确顺序连续完成。传统分层视觉-语言-动作模型往往在每个决策点只进行一次前向推理,面对关键选择时没有额外的“思考预算”。τ₀-VLA 试图改变这一点:机器人可以在行动前比较几种可能的未来,再决定下一步做什么。
方法:高层规划,低层执行
τ₀-VLA 是一个分层机器人基础模型。高层策略维护执行记忆,记录任务已经完成的内容与当前状态,并据此提出下一个子任务。当决策较为明确时,系统可以直接输出;当候选方案存在不确定性时,它会分配更多测试时计算,生成多个候选子任务。
接下来,世界模型用于预测不同候选动作可能带来的视觉结果。高层策略通过比较这些预测结果,选择更有希望的子任务,然后将其交给通用低层 VLA。低层策略负责在不同机器人本体上执行具体操作。这样的设计把“下一步该做什么”和“如何完成这一步”分开,同时允许计算资源集中投入到更困难或后果更重大的决策上。
实验结果
- 低层策略使用 40,115 小时异构真实世界机器人数据训练,并采用多模态协同训练。
- 在域内和分布偏移设置中,选择性增加测试时计算,使下一子任务预测准确率提升 15 至 24 个百分点。
- 实际评测覆盖包含 13 至 25 个有序步骤的操作任务,单个回合最长可达 12 分钟。
- 在四项长程任务上,使用同一低层策略时,分层规划将平均闭环成功率从 27.5% 提升至 45.0%。
意义与局限
τ₀-VLA 的关键价值在于把测试时计算引入机器人高层规划。它不再假设每个决策都值得使用相同的推理成本,而是让系统在不确定时进行候选搜索,在简单情形下保持更直接的响应。这种“按需思考”尤其适合长程任务,因为早期一次错误的子任务选择,可能会在后续步骤中持续放大。
不过,额外计算并不等于无限制地延长规划过程。方案效果依赖高层策略、世界模型以及低层执行器之间的配合;预测出的视觉后果也未必完全等同于真实世界结果。因此,τ₀-VLA 更像是为机器人基础模型提供了一种可扩展的决策机制,而不是彻底解决长程操作中的感知、执行和恢复问题。项目已发布代码与低层 VLA 预训练检查点,高层策略则计划后续发布。
评论
正在确认登录状态……
正在加载评论……