返回文章列表
世界模型

DreamTrue:让机器人世界模型更忠实地遵循动作

阅读约 3 分钟

导语

机器人世界模型的目标,不只是生成看起来连贯的未来视频,更要回答一个控制问题:如果机器人执行了某个动作,环境是否会按照这个动作产生合理变化?DreamTrue 关注的正是这一点。论文将其定义为一个多视角、跨本体的机器人世界模型,重点提升动作遵循能力以及接触交互的物理可信度。

两个关键瓶颈

现有机器人数据集往往记录了大量操作过程,但仍存在两类结构性问题:

  • 动作与视觉信息难以精确对齐。 机器人标定误差会使动作轨迹在图像中的位置出现偏差,模型因此可能生成与输入动作不一致的未来。
  • 失败交互覆盖不足。 数据通常更容易保留成功操作,导致模型倾向于预测“事情会顺利完成”,却不擅长表现碰撞、抓取失败、物体滑落等情况。

这两点会直接影响世界模型作为策略训练工具的价值。如果模型不能真实呈现动作后果,策略可能在“想象”中表现良好,却在现实中遭遇未被建模的失败。

DreamTrue 的方法

DreamTrue 首先把动作轨迹渲染为图像空间中的条件,再利用离线几何校准,使这些条件与目标视频中的机器人和物体位置更一致。相比直接依赖原始动作标注,这种做法试图让模型在视觉层面更清楚地理解“机器人将从哪里移动、如何接触目标”。论文还强调跨本体能力,即在不同机器人形态之间共享动作到视觉结果的建模方式。

第二步是反事实后训练。研究团队对已经记录的动作轨迹进行修改,并据此生成具有不同动作和接触配置的未来视频。它不要求所有扩展样本都来自真实执行,而是用模型构造出更宽的交互分布,让训练过程看到更多可能失败或偏离预期的结果。

但反事实视频没有天然配套的真实未来作为标准答案。为解决这一反馈问题,团队建立了人工标注的视频数据集,覆盖机器人缺陷、物体缺陷和交互缺陷,并据此训练具身视频奖励模型。该模型为生成结果打分,随后通过强化学习后训练,推动世界模型减少不合理的接触和运动结果。

结果与意义

在 AgiBot 上,DreamTrue 获得了论文所称的当前最佳动作遵循表现;人工评估的交互缺陷率从 48.12% 降至 6.25%。它还在 AgiBot World Challenge 2026 的世界模型赛道中排名第一。需要注意的是,素材没有给出完整的实验设置、基线构成或各项指标细节,因此这些结果仍应结合论文全文进一步判断。

DreamTrue 的价值不只在于视频画质,而在于把世界模型训练从“复现成功示范”推进到“评估动作后果”。动作空间扩展、缺陷标注和奖励模型结合后,世界模型有望更适合作为机器人策略的离线训练与筛选环境。不过,反事实生成是否能准确覆盖真实失败模式,以及跨机器人本体的泛化能否迁移到更多平台,仍是后续需要验证的问题。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
WorldGuide:让视频世界模型从“生成画面”走向“执行任务”
世界模型
cctest.ai
世界模型

WorldGuide:让视频世界模型从“生成画面”走向“执行任务”

WorldGuide 将程序化视频生成建模为一个闭环任务执行过程:模型根据当前视觉状态规划下一步原子动作,生成对应视频,再依据结果继续执行或结束任务。研究团队同时推出包含约 5.9 万段分步标注视频的 WorldGuide Bench。

阅读全文