PhiZero:用“物理语言”重构世界模型的推理路径
PhiZero 提出一种围绕“物理语言”构建的物理世界模型,把世界状态变化压缩成离散表示,再用于推理和视频生成。它试图把传统像素级预测中的隐式动力学,转化为更可解释的中间推理过程。
阅读全文PhiZero 提出一种围绕“物理语言”构建的物理世界模型,把世界状态变化压缩成离散表示,再用于推理和视频生成。它试图把传统像素级预测中的隐式动力学,转化为更可解释的中间推理过程。
阅读全文李飞飞创办的 World Labs 发布 R2S2R 引擎,试图把真实机器人任务重建为可交互仿真世界,再把仿真中训练和评估出的策略部署回现实硬件。
阅读全文Wonder 试图把视频生成推进到“可游玩世界”的形态:用户可从一张图或一段视频出发,通过移动摄像机实时探索未见区域,并在长时间生成中保持场景一致性。
阅读全文NVIDIA 在 Hugging Face 发布 Cosmos-H-Dreams,将外科手术生成式模拟从离线视频预测推进到可闭环控制的实时环境。其核心是把 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步生成的学生模型,并通过 FlashDreams 加速推理。
阅读全文WorldWeaver 提出在流式自回归扩散视频模型中加入“世界状态寄存器”,用于跨智能体、跨视角维护共享环境信息。它把多智能体世界模型从单纯延续画面历史,推进到显式追踪状态一致性的方向。
阅读全文兔展智能联合北大、鹏城实验室推出的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,并已开源代码与权重。它的关键看点在于:用统一模型处理单图 3D 与视频 4D 新视角生成,并强化相机位姿控制。
阅读全文AlayaWorld 试图把文本、图像或视频输入转化为可探索、可持续演化的虚拟环境。它围绕长时程一致性、交互控制和推理效率,提出了一套基于视频扩散 Transformer 的世界建模方案。
阅读全文ABot-World-0 试图把“可控制的视频生成”推进到可实时闭环交互的世界模型形态。它围绕数据、训练蒸馏和推理系统做了端到端设计,在单张 RTX 5090 上实现 720P 最高 16 FPS 流式生成。
阅读全文这篇论文提出 Masked Visual Actions,把动作表达为视频中某个实体被部分揭示的像素轨迹。它让同一个视频模型既能预测机器人动作带来的场景变化,也能从目标物体运动反推机器人应如何行动。
阅读全文Alaya Lab 提出的 AlayaRenderer-Flash 将生成式世界渲染从 0.56 FPS 提升到 31.54 FPS,让由物理引擎驱动的交互式场景接近实时可玩。它不是用文本直接“想象”视频,而是在保留世界状态和动力学的前提下合成 RGB 画面。
阅读全文这项工作把“文学世界模拟”从静态角色扮演推进到长程演化:角色会变化,场景会推进,世界状态也会被持续更新。它的重点不是单次生成,而是让多轮互动保持一致性与延续性。
阅读全文这篇论文把文本世界模型重新定义为可控的状态转移问题,并提出用 Masked Diffusion Language Models 缓解自回归模型的左到右偏置。实验显示,MDLM 在一致性、扎根性和 rollout 多样性上优于更大参数量的自回归模型。
阅读全文NVIDIA 在 Hugging Face 上发布 Cosmos 3 Edge,一个面向机器人与视觉 AI 的 4B 参数开放世界模型。它试图在边缘设备上同时承担场景理解、未来预测与动作生成任务。
阅读全文DSWorld 将世界模型思想引入自治数据科学智能体,通过预测操作后的状态变化,减少昂贵的试错执行。论文称,该框架可将强化学习训练加速约 14 倍,并将搜索式推理加速约 3 至 6 倍。
阅读全文字节跳动团队提出 UniVR,尝试让模型仅从视觉演示中同时学习复杂推理、细粒度物理动态和长期规划。其核心在于 VR-GRPO 强化学习范式,以及面向纯视觉协议的 VR-X 基准。
阅读全文一篇新论文将“视频生成式游戏引擎”的讨论拉回到传统游戏引擎的基本循环:动作、状态与观察。作者认为,真正可玩的交互世界不仅要生成画面,还要让规则、后果与状态在长时间内保持一致。
阅读全文arXiv 新论文提出 M⁴World,一个可生成环视视频与同步 LiDAR 的驾驶世界模型,重点解决可控场景编辑与长时间稳定生成两类问题。其亮点在于支持对象级操控,并能以在线因果方式进行分钟级连续流式生成。
阅读全文