返回文章列表
机器人与物理 AI

τ₀-VLA:让机器人在行动前比较可能的未来

阅读约 2 分钟

长程机器人操作的难点,不只是把一个动作做对,还要把十几个动作按照正确顺序连续完成。传统分层视觉-语言-动作模型往往在每个决策点只进行一次前向推理,面对关键选择时没有额外的“思考预算”。τ₀-VLA 试图改变这一点:机器人可以在行动前比较几种可能的未来,再决定下一步做什么。

方法:高层规划,低层执行

τ₀-VLA 是一个分层机器人基础模型。高层策略维护执行记忆,记录任务已经完成的内容与当前状态,并据此提出下一个子任务。当决策较为明确时,系统可以直接输出;当候选方案存在不确定性时,它会分配更多测试时计算,生成多个候选子任务。

接下来,世界模型用于预测不同候选动作可能带来的视觉结果。高层策略通过比较这些预测结果,选择更有希望的子任务,然后将其交给通用低层 VLA。低层策略负责在不同机器人本体上执行具体操作。这样的设计把“下一步该做什么”和“如何完成这一步”分开,同时允许计算资源集中投入到更困难或后果更重大的决策上。

实验结果

  • 低层策略使用 40,115 小时异构真实世界机器人数据训练,并采用多模态协同训练。
  • 在域内和分布偏移设置中,选择性增加测试时计算,使下一子任务预测准确率提升 15 至 24 个百分点。
  • 实际评测覆盖包含 13 至 25 个有序步骤的操作任务,单个回合最长可达 12 分钟。
  • 在四项长程任务上,使用同一低层策略时,分层规划将平均闭环成功率从 27.5% 提升至 45.0%。

意义与局限

τ₀-VLA 的关键价值在于把测试时计算引入机器人高层规划。它不再假设每个决策都值得使用相同的推理成本,而是让系统在不确定时进行候选搜索,在简单情形下保持更直接的响应。这种“按需思考”尤其适合长程任务,因为早期一次错误的子任务选择,可能会在后续步骤中持续放大。

不过,额外计算并不等于无限制地延长规划过程。方案效果依赖高层策略、世界模型以及低层执行器之间的配合;预测出的视觉后果也未必完全等同于真实世界结果。因此,τ₀-VLA 更像是为机器人基础模型提供了一种可扩展的决策机制,而不是彻底解决长程操作中的感知、执行和恢复问题。项目已发布代码与低层 VLA 预训练检查点,高层策略则计划后续发布。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Ego2Robot:把第一人称人类视频变成机器人训练数据的可扩展方案
机器人与物理 AI
cctest.ai
机器人与物理 AI

Ego2Robot:把第一人称人类视频变成机器人训练数据的可扩展方案

这项工作提出了一条把第一人称人类操作视频转换为机器人训练数据的流水线,目标不是做单个任务的演示复刻,而是为具备泛化能力的视觉-语言-动作模型提供大规模预训练数据。研究同时给出了更系统的泛化评测框架。

阅读全文