返回文章列表
机器人与物理 AI

τ₀-VLA:让机器人在行动前比较可能的未来

阅读约 2 分钟

长程机器人操作的难点,不只是把一个动作做对,还要把十几个动作按照正确顺序连续完成。传统分层视觉-语言-动作模型往往在每个决策点只进行一次前向推理,面对关键选择时没有额外的“思考预算”。τ₀-VLA 试图改变这一点:机器人可以在行动前比较几种可能的未来,再决定下一步做什么。

方法:高层规划,低层执行

τ₀-VLA 是一个分层机器人基础模型。高层策略维护执行记忆,记录任务已经完成的内容与当前状态,并据此提出下一个子任务。当决策较为明确时,系统可以直接输出;当候选方案存在不确定性时,它会分配更多测试时计算,生成多个候选子任务。

接下来,世界模型用于预测不同候选动作可能带来的视觉结果。高层策略通过比较这些预测结果,选择更有希望的子任务,然后将其交给通用低层 VLA。低层策略负责在不同机器人本体上执行具体操作。这样的设计把“下一步该做什么”和“如何完成这一步”分开,同时允许计算资源集中投入到更困难或后果更重大的决策上。

实验结果

  • 低层策略使用 40,115 小时异构真实世界机器人数据训练,并采用多模态协同训练。
  • 在域内和分布偏移设置中,选择性增加测试时计算,使下一子任务预测准确率提升 15 至 24 个百分点。
  • 实际评测覆盖包含 13 至 25 个有序步骤的操作任务,单个回合最长可达 12 分钟。
  • 在四项长程任务上,使用同一低层策略时,分层规划将平均闭环成功率从 27.5% 提升至 45.0%。

意义与局限

τ₀-VLA 的关键价值在于把测试时计算引入机器人高层规划。它不再假设每个决策都值得使用相同的推理成本,而是让系统在不确定时进行候选搜索,在简单情形下保持更直接的响应。这种“按需思考”尤其适合长程任务,因为早期一次错误的子任务选择,可能会在后续步骤中持续放大。

不过,额外计算并不等于无限制地延长规划过程。方案效果依赖高层策略、世界模型以及低层执行器之间的配合;预测出的视觉后果也未必完全等同于真实世界结果。因此,τ₀-VLA 更像是为机器人基础模型提供了一种可扩展的决策机制,而不是彻底解决长程操作中的感知、执行和恢复问题。项目已发布代码与低层 VLA 预训练检查点,高层策略则计划后续发布。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
MotorMind:让通用视觉语言模型直接尝试操作机器人
机器人与物理 AI
cctest.ai
机器人与物理 AI

MotorMind:让通用视觉语言模型直接尝试操作机器人

MotorMind提出一种连接通用视觉语言模型与机器人控制器的执行框架,让模型根据视觉观察提出中层动作,并通过异步反馈持续调整。研究显示,在无需任务专用策略训练的情况下,通用VLM也能完成一定程度的零样本机器人操作。

阅读全文
CCTest · Blog
Skill2Real:让机器人技能从仿真直接走向现实
机器人与物理 AI
cctest.ai
机器人与物理 AI

Skill2Real:让机器人技能从仿真直接走向现实

Skill2Real提出一种面向机器人操作的智能体式技能学习框架,通过统一API、分层记忆和提议者—验证器—治理器闭环,减少仿真到现实迁移中的再训练需求。实验显示,冻结的仿真技能在多项真实操作任务上仍能保持较高完成率。

阅读全文
CCTest · Blog
少看图、少调用,机器人反而更会做事:PyRUA-Lean如何让GPT-6 Astra提效
机器人与物理 AI
cctest.ai
机器人与物理 AI

少看图、少调用,机器人反而更会做事:PyRUA-Lean如何让GPT-6 Astra提效

一项发表于Hugging Face Daily Papers的研究提出PyRUA-Lean,让机器人智能体通过可执行Python单元组合动作、局部重试,并只请求必要的视觉与状态反馈。在相同语言模型调用预算下,任务成功率从63.1%提升至71.7%,共同完成任务的输入Token减少65%。

阅读全文