触觉数据走向核心基建:NeoteAI 与复旦发布 N0 系列报告
导语
机器人在镜头里“看懂”一个杯子、插头或毛巾,并不等于它能稳稳拿住、顺利插入或整齐叠好。真实物理交互的最后一厘米,往往发生在接触瞬间:有没有顶到边缘、夹力是否过大、物体是否滑移,这些信息不是普通 RGB 摄像头能直接给出的。
NeoteAI 与复旦大学可信具身智能研究院发布的 N0 系列三份技术报告,正是围绕这一痛点展开。它们试图把触觉从机器人系统里的“附加传感器”,提升为具身智能的数据底座和模型核心能力。
核心要点
-
N0-Foundation:先解决触觉数据不统一的问题。 触觉传感器形态差异很大,有的输出凝胶形变图,有的输出电容矩阵或六维力向量。NeoteAI 构建的 NeoData 数据集包含超过 3 万小时视觉-触觉交互数据,约 140 万条操作片段、33 亿个时间步,覆盖 450 项真实长程任务,并使用 Franka、Piper、UR5e 等 6 种机器人本体采集。目前项目已开源 5000 小时视觉-触觉交互数据。
-
NeoForce:把不同触觉“方言”转成统一表征。 报告提出的统一表征模型 NeoForce,目标是在不同硬件输出之间学习可迁移的触觉表示,让下游策略能理解接触位置、压力大小和横向拉扯等信息。
-
N0-VTLA:不只读取当前触觉,而是预测未来触觉。 研究团队认为,触觉信号通常只在接触时高频出现,如果简单与视觉 token 拼接,容易被视觉信息淹没;而当前触觉本身也带有滞后性。N0-VTLA 的做法是预测未来 50 步内的触觉变化,用于提前调整动作。在插插头任务中,报告给出的成功率为 85%,高于视觉方案的 60%;拔钥匙任务中为 99%,视觉方案为 35%。
-
从失败中学习。 N0-VTLA 还结合触觉信息、部署后数据和 human in the loop 数据训练进度评估模型,再配合离线强化学习,使毛巾折叠、书包收纳、纸箱折叠等任务成功率分别从 50%、35%、20%提升至 95%、80%、75%。
-
N0-TWAM:把触觉纳入世界模型。 该模型同时预测未来视频、触觉和动作序列,采用视频、触觉、动作三个异步专家网络,总参数量 72 亿。报告称其在仿真平均成功率达到 84.5%,真机 8 项任务平均成功率为 46.3%。
意义与影响
这组三份报告的共同指向,是具身智能范式从“视觉驱动”转向“视触融合”。过去很多机器人失败并非看错了,而是没有在接触中及时理解力、摩擦和滑移。触觉数据规模化、统一表征和未来触觉预测,可能成为机器人处理精细操作的重要基础。
当然,触觉路线仍有现实挑战:数据采集成本高,不同机器人本体和传感器之间的泛化并不容易,实时推理也会带来工程压力。但如果开源数据和模型能被更多研究者复用,触觉有机会从小众模态变成具身智能的基础设施之一。
来源:量子位
评论
正在确认登录状态……
正在加载评论……