InternW0:让物理世界模型从“预测”走向可执行控制
导语
传统世界模型往往关注一个问题:未来会怎样。但对于机器人而言,仅仅预测下一刻的画面并不够,预测结果还必须能及时转化为动作,并在环境持续变化时保持有效。上海人工智能实验室提出的 InternW0,试图把物理世界建模从“生成未来”推进到“持续决策”。论文将其定位为 InternW 系列的首个实现,重点解决现实交互中的异步控制、部分观测和多种机器人形态适配问题。
核心设计
InternW0的关键并不是单独扩大视频模型,而是让不同模块承担不同时间尺度的工作。
- 视频与动作分工:模型采用非对称的视频—动作架构。高容量视频专家负责提供较长时间范围的动态预测与上下文,轻量动作专家则以更快频率输出连续机器人控制信号。这样既保留了对未来过程的整体判断,又避免每次动作更新都调用完整的视频预测流程。
- 缓存并适应新观测:在控制过程中,世界状态会不断变化。InternW0复用网络各层的 K/V 缓存,再通过观测条件上下文路由,将新获得的视觉信息融入已有预测上下文。相比反复重新生成未来,这种设计更适合需要高频反馈的交互任务。
- 面向异构实体的接口:模型使用领域专用接口和软提示,处理不同机器人本体、传感器输入和控制表达方式。这使同一套物理建模框架能够覆盖更广泛的具身平台,而不必将所有差异都交给主干模型学习。
- 补充接触信息:对于抓取、按压和移液等任务,视觉并不能完整描述接触状态。论文在后训练阶段加入力和触觉信号,使模型能够面向接触密集型操作进行调整。
数据与验证
研究团队使用约 7,200 小时的异构机器人与第一视角数据训练模型,其中包括 275 小时的真实实验室第一视角数据集 EgoLab。评估覆盖仿真基准和现实科学任务,后者包括一个 15 阶段的金属—有机框架合成流程,以及一个包含 5 个阶段、需要接触与力觉感知的通用定量移液操作。素材显示,这些实验被用于检验模型在长流程、科学实验和精细接触控制中的实际适用性,但没有提供足够的结果表格或统一指标,因而不宜仅凭摘要比较其相对性能。
意义与局限
InternW0的重要性在于,它把世界模型的效率问题与控制频率问题放在同一架构中处理:慢速、容量较大的模块负责理解更长的未来,快速模块负责跟随实时状态修正动作。对于实验室自动化而言,这种思路尤其有价值,因为化学流程和移液操作同时要求多步骤规划、精确执行以及对意外接触的响应。
不过,现有材料主要是论文摘要和页面信息,尚不足以判断模型在不同机器人之间迁移的稳定性、缓存复用带来的具体加速幅度,以及真实任务中的成功率和失败模式。后续还需要完整论文、公开代码或更细致的消融实验,来验证异步架构、上下文路由和触觉后训练各自的贡献。总体来看,InternW0展示了一条将视频预测、连续控制与科学实验场景结合的技术路线,也反映出物理世界模型正从离线预测走向面向行动的实时交互。
评论
正在确认登录状态……
正在加载评论……