ACE-Data-0:把真实家庭变成具身智能的数据采集场
导语
具身智能的瓶颈并不只在模型架构,也在数据。机器人或 embodied AI 要学会在真实世界中行动,需要理解人如何看见环境、移动身体、操作物体、感知接触,并在较长时间内围绕目标做出连续决策。ACE-Data-0 这篇论文的重点,正是把这种完整的“感知—动作—接触”过程尽可能同步地记录下来。
核心要点
- 一个面向人的环境采集引擎:论文提出 Ambient Capture Engine(ACE),将真实家庭环境改造成经过空间标定、时间同步的记录系统,而不是只在实验室桌面或单一摄像头下采集动作。
- 覆盖两种空间尺度:ACE 包含桌面尺度和房间尺度两类配置。前者更关注手与物体之间的精细操作,后者记录人在带家具的家庭空间中走动、转身、搬取物品和完成连续活动。
- 多模态同步记录:数据不仅有第一视角和多视角第三人称视频,还包括全身动作、关节化手部动作、物体几何与 6-DoF 轨迹、音频和触觉信号,形成统一的多感官数据流。
- 规模与任务覆盖:ACE-Data-0 包含 150 小时数据、1700 万视频帧、200 类任务,由 50 名参与者在 2 个环境中完成,总计 7.5 万个交互片段。任务既有原子级操作,也有较长时程的家务链条和人与场景互动。
- 更接近自然行为:研究者采用目标级指令,而非逐步指令,让参与者保留自己的完成方式,从而捕捉更自然的行为差异。
意义与影响
过去的具身数据集常常在视角、模态或空间范围上被切碎:有的看得到手却看不到全身,有的有外部视频却缺少第一视角,有的记录动作却缺少触觉或物体状态。ACE-Data-0 的价值在于把这些线索放回同一条时间线上,使模型能学习“看到什么、手怎么动、物体如何变化、接触何时发生”之间的对应关系。
论文还提出了从信号、场景组件到交互的分层基准,并指出现有先进方法在接触、遮挡、自运动和长时间跨度任务下仍有明显不足。这意味着该数据集不仅是训练资源,也可能成为检验具身模型是否真正理解连续物理交互的压力测试。
对模仿学习、世界模型、视觉-语言-动作系统和家庭机器人而言,ACE-Data-0 提供了一种更接近真实人类示范的采集范式。不过,它目前仍只是两个环境、50 名参与者的数据起点。真正的挑战在于如何把这种高质量同步采集扩展到更多家庭、更多物体和更复杂的开放任务中。
评论
正在确认登录状态……
正在加载评论……