返回文章列表
机器人与物理 AI

TacForcing:让机器人在执行动作时真正“感受”触觉

阅读约 3 分钟

导语

机器人在抓取、插入、按压等接触丰富的任务中,视觉往往只能告诉系统“物体在哪里”,却不能完整描述接触是否稳定、力度是否合适,以及末端执行器是否已经碰到障碍。触觉因此成为调整动作的重要信号。但如何让视觉语言动作(VLA)模型在动作执行过程中及时使用触觉,仍是一个工程与建模上的难题。

问题:动作块与触觉反馈不同步

许多基于动作块的VLA策略会根据执行前采集的观测,一次性预测一段完整动作。这样的设计有利于提高推理效率,却带来明显的时间错配:动作开始执行后,接触状态可能迅速变化,而此前生成的动作仍然依据旧观测,无法响应新的触觉信息。

已有触觉反应方案通常会额外配置高频控制器,在底层快速修正动作。这种做法虽然能够增强反应能力,但也意味着系统需要更多模块、独立的训练流程和更复杂的接口,增加了整体架构负担。

TacForcing如何工作

TacForcing的核心不是再增加一个反应式控制器,而是用“流式动作专家”替换标准动作专家。系统不再把整段动作视为一次性、不可修改的预测结果,而是渐进式地生成和执行动作块;对于尚未执行的部分,则结合执行期间新获得的触觉观测进行更新。

论文还提出执行感知触觉注意力(Execution-Aware Tactile Attention,EATA):

  • 将触觉条件重点施加到即将执行的动作上;
  • 减少较早采集的触觉信息与较晚执行动作之间的时间错配;
  • 让模型把计算和条件建模资源集中在最需要即时反馈的动作片段。

这种设计试图在保持动作生成连续性的同时,让模型对接触状态变化保持敏感。它并非简单地把触觉信号拼接到输入中,而是进一步考虑“这条触觉信息应该影响哪一段动作”。

实验结果与意义

在六项模拟UniVTAC任务和三项真实世界接触丰富操作任务中,TacForcing分别取得65%和69%的平均成功率,并在两类环境中超过强基线。素材没有提供更细的任务级结果或消融数据,因此这些数字更适合作为整体性能概览,而不应被解读为对所有场景都同样有效。

从方法论看,TacForcing的价值在于把触觉反馈纳入动作生成主循环,而不是将触觉仅视作一个外挂式的底层修正机制。若这一思路能够扩展到更多传感器和更复杂的操作流程,未来的机器人策略或许可以在统一模型中同时完成感知、动作预测与执行中修正。不过,真实部署仍需关注传感器延迟、流式推理开销、不同触觉硬件之间的迁移,以及代码和训练细节公开后才能进一步评估的复现性问题。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Zero-WAM:让机器人通过观看人类视频泛化到未见任务
机器人与物理 AI
cctest.ai
机器人与物理 AI

Zero-WAM:让机器人通过观看人类视频泛化到未见任务

Zero-WAM 将人类操作视频作为机器人策略的上下文提示,使机器人无需更新参数即可尝试训练阶段未出现的操作任务。研究团队还构建了包含 7.42 万组人机配对样本的 HumanGen 数据集,并在仿真测试中验证了方法的跨任务泛化能力。

阅读全文
CCTest · Blog
StreamPI:让单帧视觉语言动作模型具备持续时序理解
机器人与物理 AI
cctest.ai
机器人与物理 AI

StreamPI:让单帧视觉语言动作模型具备持续时序理解

StreamPI在不增加模型参数的前提下,为以单帧输入为主的视觉语言动作模型引入流式时序建模。通过指令锚定注意力与随机间隔训练,它试图让机器人更好地利用历史观察,并适应真实部署中的异步视觉输入。

阅读全文