返回文章列表
机器人与物理 AI

让3D扩散策略具备“趋势感”:无需显式轨迹也能预判操作方向

阅读约 3 分钟

导语

机器人操作并不只是“看见什么就立刻怎么动”。在抓取、推、放置等连续交互中,当前可行的动作往往取决于物体和夹爪接下来会如何运动。3D扩散策略擅长从当前视觉与几何观测生成动作,但对交互趋势的利用通常是隐式的,模型需要在动作学习过程中自行摸索“下一步会发生什么”。

来自大连理工大学的研究团队提出 Movement Trend Guidance(运动趋势引导),试图在不引入显式规划轨迹的前提下,为3D扩散策略补充这种前瞻能力。相关工作以DP3为基础,保持了原有的密集动作预测和滚动时域执行方式。

核心方法

  • 从短历史中提取趋势信息:模型不只读取单帧观测,而是利用一小段观测历史,学习一个紧凑的潜在表示,用来描述交互状态如何演化。
  • 训练时看未来,推理时不依赖未来:训练阶段通过稀疏的未来夹爪状态监督潜变量,使其编码动作发展的方向;部署时并不需要未来状态,只使用已经从历史观测中得到的潜变量。
  • 同时提供全局与局部调制:趋势潜变量作为动作生成的全局条件输入;此外,方法在UNet瓶颈位置加入一个带门控的FiLM分支,让趋势信息能够在关键特征层发挥作用。
  • 保持扩散策略原有范式:研究没有把系统改造成必须先生成完整轨迹的规划器,因此仍可沿用密集动作输出和receding-horizon控制流程。

实验结果

在50任务混合训练的RoboTwin2.0设置中,加入趋势引导后的成功率为62.8%,DP3为56.1%。在LIBERO-40上,两者分别为71.93%和37.08%;在五项真实机器人任务中,结果分别为72.0%和49.0%。论文还报告称,该模块只增加了3.52%的参数量,并在RoboTwin2.0、LIBERO-40和DexArt相关评测中整体优于基础DP3。

这些结果说明,机器人策略未必需要一个逐点明确的未来轨迹,才能获得前瞻性。一个经过未来状态监督、但在部署时只以潜变量形式存在的趋势表示,也可能为动作生成提供有用的方向性信息。

意义与局限

这项工作的价值在于把“预测交互走向”和“生成具体动作”拆成了两个相互配合、但不必显式串联的部分。策略可以继续保持扩散模型的动作生成灵活性,同时借助潜变量减少只根据当前画面做局部反应的倾向。较小的参数增量也使其更容易作为现有3D扩散策略的附加模块进行验证。

不过,现有材料主要给出了方法概述和基准结果,尚未展示不同历史长度、未来监督稀疏程度或趋势表示设计之间的详细消融。因此,趋势潜变量在不同任务中的可解释性、对观测噪声的鲁棒性,以及迁移到更复杂长时程操作时的效果,仍有待进一步研究。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
VABench:让多模态模型在真实空间中看、想、做与纠错
机器人与物理 AI
cctest.ai
机器人与物理 AI

VABench:让多模态模型在真实空间中看、想、做与纠错

VABench 不再只考察模型能否说出物体在哪里,而是进一步测试其在信息不完整时主动观察、建立空间关系、发出精确动作并依据反馈修正的能力。结果显示,模型在定位等基础能力上表现较好,但距离稳定完成复杂操作仍有明显差距。

阅读全文
CCTest · Blog
GPT-Policy:让机器人在部署现场从上下文中学习
机器人与物理 AI
cctest.ai
机器人与物理 AI

GPT-Policy:让机器人在部署现场从上下文中学习

GPT-Policy 将视觉语言模型、上下文编译器与受约束控制器结合,让机器人能够参考示范和交互反馈,在不更新梯度或任务参数的情况下适应新任务。研究显示,人类视频示范可以提升任务完成度,而带有动作对齐信息的参考对接触敏感任务更有帮助。

阅读全文