返回文章列表
机器人与物理 AI

RoboTok:从互联网视频中检索灵巧操作示范,降低机器人数据门槛

阅读约 2 分钟

导语

机器人要学会灵巧操作,往往需要大量覆盖不同物体、环境和动作方式的示范数据。但真实机器人数据的采集成本高、规模有限,也很难覆盖现实任务中的长尾情况。RoboTok 提出的思路是:不把互联网视频仅仅看作视觉素材,而是将其作为可持续扩展的人类操作示范库。

核心方法

RoboTok 以一段人类操作视频作为查询,检索网络视频中执行相似操控动作的示范。与依赖画面外观或场景语义的常见检索方式不同,它重点关注手部运动轨迹:

  • 系统从视频中估计三维手部轨迹,并将其表达在以动作主体为中心的参考坐标系中。
  • 经过规范化后,来自不同摄像机角度、不同场景和不同人物的动作,可以在更统一的空间里进行比较。
  • 研究团队进一步学习潜在运动空间,将复杂的手部姿态序列压缩为适合大规模搜索和持续索引的表示。
  • 当新的查询视频输入后,系统可根据手部动作相似性,从互联网视频集合中返回相关的人类示范。

这种设计抓住了灵巧操作中的关键线索:同一个“抓取、旋转、放置”行为,即使背景、物体外观和拍摄方式不同,手部的时空变化仍可能具有相似结构。相较于直接比较整段视频,手部轨迹表示有望减少无关视觉因素带来的干扰,也能在部分遮挡存在时保留更有价值的动作信息。

实验与意义

素材显示,RoboTok 在检索基准和下游机器人策略性能上都进行了评估,结果表明它能够检索到更相关的操作示范,并改善后续任务成功表现。这里的价值并不只是增加一个视频搜索工具,而是尝试打通“互联网人类视频—动作表示—机器人学习”这条数据链路。

如果这类方法能够与更可靠的三维姿态估计、视频筛选和跨形体动作映射结合,机器人训练数据的来源就不必局限于实验室采集。研究也提醒我们,互联网视频并非拿来即可训练的现成机器人数据:人类与机器人在身体结构、感知视角和执行能力上存在差异,检索到的示范仍需要进一步对齐、过滤和转换。RoboTok 的贡献主要在于提供了一种可扩展的候选数据发现机制,为持续利用开放网络中的操作知识提供了路径。

项目公开了代码、数据和模型,便于社区进一步验证其检索能力以及对不同机器人平台的适用性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章