机器人为什么开始“看人干活”:Riemann-1.0的路线信号
导语
黎曼动力在 WAIC 2026 发布 Riemann-1.0 后,最受关注的不是“首秀登榜”本身,而是它背后的训练思路:让机器人先大量观看人类如何做饭、叠衣服、收拾桌面,再用机器人数据把这些经验对齐到可执行动作上。在 RoboCasa-365 这一长流程家务基准中,Riemann-1.0 给出的成功率为 62.6%,比此前 SOTA 高出 8.4 个百分点。
核心要点
- 数据结构发生变化:Riemann-1.0 使用约 23.2 万小时训练数据,其中 20 万小时以上是人类第一视角视频,另有 1.2 万小时以上 UMI 与外骨骼手套数据,以及 2 万小时以上机器人真机和仿真轨迹,覆盖 41 种机器人本体。
- 路线是混合式的:它被定位为 World Action Model,试图同时具备 VLA 的动作输出能力和世界模型的环境演化预测能力。简单说,模型不仅要判断“看到了什么”,还要理解“动作之后世界会怎样变化”。
- 难点在于无动作标签:人类视频没有机器人的关节角、夹爪力度等控制信号。黎曼动力的做法是先对第一视角视频做纠偏、语义切分、质量筛选、手部 3D 重建和轨迹估计,再把这些视频变成可用于训练的动作线索。
- 训练分阶段推进:模型先从人类视频中学习物理直觉,再引入 UMI 和机器人动作数据校准,最后用机器人数据强化可执行控制能力。素材中提到的动作损失权重从 0.1、0.5 到 0.9,体现了从“理解世界”到“执行动作”的重心迁移。
意义与影响
这项发布的更大价值,是验证了人类视频对机器人泛化能力的增益。消融实验显示,在 RoboCasa-365 上加入人类视频后,成功率从 48.2% 提升到 62.6%;在 EgoVLA 基准中,加入人类视频预训练也显著改善了长程任务和陌生视觉背景下的表现。
这意味着,具身智能的数据瓶颈可能不再只依赖昂贵的机器人遥操作采集。开放世界中的人类操作视频,虽然嘈杂、无标签,却包含大量物体交互、任务顺序和环境变化信息。谁能把这类数据清洗、建模并对齐到真实机器人动作,谁就可能在家务、仓储、实验室自动化等长流程任务中取得优势。
当然,榜单成绩和真机演示还不能等同于大规模商业落地。家庭场景的杂乱性、安全要求、硬件成本和可靠性仍会持续考验这一路线。但 Riemann-1.0 至少释放了一个清晰信号:下一代机器人大脑,正在从“只学机器人怎么动”,转向“先理解人类如何改变世界”。
来源:量子位
评论
正在确认登录状态……
正在加载评论……