返回文章列表
机器人与物理 AI

N₀-TWAM:把“触觉预测”放到机器人世界模型的中心

阅读约 2 分钟

导语

在机器人操作中,很多关键动作并不是“看见”就能完成的。插入、按压、抓取、旋拧、对齐等接触密集型任务,往往依赖细微的力和接触变化。N₀-TWAM 的核心主张是:触觉不应只是视觉模型旁边的辅助输入,而应成为世界模型预测未来的一部分。

这项工作提出了一个触觉原生的 world-action model。模型同时预测未来视觉与未来接触,并从这种联合预测的未来状态中读取动作,用于接触丰富的机器人操作。

核心要点

  • 触觉与视觉共同预测未来:N₀-TWAM 不把触觉当作后处理信号,而是在同一因果步骤下预测未来图像和未来接触,让动作生成建立在“看见什么”和“摸到什么”的共同预期上。
  • 大规模视觉-触觉预训练:模型使用触觉丰富的演示数据进行联合训练,覆盖 6 种具身形态和 450 个任务。这使其能够学习跨平台、跨任务的接触规律。
  • NeoForce 统一触觉表示:论文引入 NeoForce,将触觉信息表达为基于力的统一表示,为动作生成提供更具物理含义的接触信号。
  • 用接触事件组织长程任务:针对多阶段、长时序操作,研究者提出“触觉接触事件”来划分任务阶段,并在执行过程中按事件推进,帮助模型处理复杂操作链条。
  • 面向实时性的架构设计:N₀-TWAM 采用非对称 Mixture-of-Transformers:较宽的专家用于视频预测,较轻量的专家负责动作和触觉预测,以兼顾预测能力与运行效率。

意义与影响

这项工作的价值在于把“触觉世界模型”从概念推进到较大规模训练。对于机器人来说,接触信息常常决定动作是否成功:夹得太轻会掉落,压得太重可能损坏物体,位置看似正确但接触状态未必正确。N₀-TWAM 试图让机器人提前想象未来的视觉变化和接触变化,从而更细致地规划动作。

如果后续代码与检查点的开放能够带来更多复现和对比,它可能推动触觉传感、视觉-语言-动作模型、世界模型和精细操作研究之间的交叉。需要注意的是,素材中只概述了其在真实与模拟基准上的有效性,具体泛化边界、传感器适配成本和真实部署稳定性仍需更多公开评测来验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章