WorldToken:让机器人按“时间步”理解多模态世界
导语
机器人模仿学习的输入并不单一:同一决策时刻可能同时包含多视角图像、关节或末端状态,以及描述任务目标的文本。如何把这些信息组织成适合序列模型处理的形式,往往和模型规模、训练数据一样重要。WorldToken 提出一种“时间优先”(time-first)的组织方式:先在每个策略时间步内融合异构观测,再沿时间轴建模机器人所经历的世界状态变化。
核心方法
WorldToken 将一个决策时刻的多视角视觉输入、本体感知和任务条件合并为单个 world token。多个时间步形成令牌序列后,由因果时间 Transformer 进行建模,使策略能够利用过去的观测推断当前行为。输出端采用扩散动作头,不是只生成一个动作,而是生成动作块,以适应连续操作过程。
这种设计的关键不在于简单增加输入模态,而在于确定序列的顶层结构:时间步是主要序列单位,同一时刻的不同传感器信息则被视为一个整体。与把视觉、状态或文本分别排成长序列的方案相比,WorldToken 试图让模型直接围绕“世界在每个时刻如何变化”建立表示。不过,现有材料并未提供与其他序列组织方式的直接对比,因此不能据此断言该结构一定更优。
实验观察
论文在 RoboCasa 的 23 项任务上进行测试。一个 8530 万参数、除冻结的预训练 CLIP 文本编码器外从头训练的策略,在每项任务使用 2900 个生成示范时,平均闭环成功率达到 59.45%。覆盖五种数据规模、五种模型规模和两个训练随机种子的完整析因实验显示:增加目标域数据能够持续带来收益,而模型规模达到中等水平后,继续扩大模型的回报开始减弱。
历史上下文是另一项重要变量。在保持同一检查点不变的情况下,将可见历史压缩到一个或两个策略时间步,会让全部 50 个 RoboCasa 策略的闭环成功率下降。在 RMBench Blocks Ranking 上,可见历史从 146 秒缩短到 8 秒时,评估器成功率由 95% 降至 28%。一次探索性长时间 rollout 还维持了超过 850 秒的参考交换序列,说明长程上下文可能与持续执行有密切关系,但这一结果属于特定实验设置,不能直接等同于通用能力。
意义与边界
WorldToken 的价值首先在于提供了一个清晰、可检验的多模态机器人策略实例:它把“同一时刻的信息融合”和“跨时刻的因果建模”分开处理,并系统考察了数据、模型容量和历史长度。结果提示,面向机器人操作时,盲目扩大网络未必是最有效的方向,目标域数据和足够的时间上下文可能更关键。
同时,论文的结论应保持克制。实验主要证明完整 WorldToken 实现具有经验可行性,并刻画了特定训练配方下的数据缩放与时间上下文行为;它没有隔离每个组件的独立贡献,也没有证明 time-first 组织方式胜过其他方案。未来仍需更严格的结构对照、跨任务泛化和真实机器人验证。
评论
正在确认登录状态……
正在加载评论……