N_0-VTLA:把触觉纳入机器人基础模型的下一步
导语
机器人操作模型近几年快速吸收视觉、语言和动作数据,但在真正需要“手感”的任务上仍然吃力:捏取柔软物体、沿接触面微调姿态、处理形变材料时,单靠摄像头往往难以判断压力、滑移和接触状态。N_0-VTLA 关注的正是这一缺口。它将视觉、触觉、语言和动作统一到一个基础模型框架中,希望让机器人在接触丰富的操作里具备更稳定的感知与控制能力。
核心要点
- 从 VLA 走向 VTLA:N_0-VTLA 建立在现有视觉驱动机器人骨干之上,但额外引入触觉信息,使策略不仅依赖图像和指令,也能使用触觉反馈进行细粒度控制。
- 大规模视觉触觉预训练:作者使用 NeoData 这一大规模视觉触觉机器人数据集进行预训练,让模型先学习广泛的接触先验。论文称,这是首个在规模化触觉数据上预训练的 VTLA 模型。
- 分阶段触觉通路整合:在后训练阶段,模型加入预测式触觉通路,把预训练阶段学到的接触模式转化为下游任务中的微动作调整能力,服务于更依赖触觉的操作场景。
- ALTER 离线策略改进:论文提出 advantage-conditioned offline RL 方法 ALTER,将相对进展和轨迹事件比较转为二值优势标签,使机器人可以利用已经收集好的部署数据继续提升策略,而不必完全依赖新的在线试错。
实验表现
根据论文摘要,N_0-VTLA 在接触密集型基准上相较强基线取得明显优势:它在 9 个真实机器人 NeoReal 任务中全部获胜;在包含 20 个任务的仿真套件上,平均成功率达到 63.8%,高于最强基线的 44.0%。结合 ALTER 后,相关策略在 3 个长时程真实机器人任务上达到 75% 到 95% 的成功率,其中包括形变物体操作。
意义与影响
这项工作的价值不只是“多加一种传感器”。对于具身智能而言,触觉可能是机器人从演示模仿走向可靠执行的关键环节:视觉能告诉机器人物体在哪里,触觉则能帮助它判断是否抓稳、是否滑动、是否需要减小或增大接触力。N_0-VTLA 给出的路线是,把触觉作为可预训练、可迁移、可与语言动作策略共同优化的模态,而不是只在特定任务中临时接入的工程补丁。
同时,ALTER 对实际部署也有吸引力。机器人数据采集成本高,失败轨迹和部分成功轨迹通常不会被充分利用。如果离线方法能从固定部署数据中提取改进信号,接触丰富技能的迭代成本有望下降。当然,论文结果仍需要更多独立复现和更广泛任务验证,但它指向了一个清晰趋势:下一代机器人基础模型要真正进入复杂物理世界,触觉很可能会成为与视觉、语言同等重要的训练信号。
评论
正在确认登录状态……
正在加载评论……