PAWBench:视频生成模型距离“概率对齐”的世界建模还有多远?
视频生成模型可以拍出看似合理的未来,但这并不意味着它理解了同一条件下可能发生的多种结果。PAWBench 将评测重点从单条视频的 plausibility 推向行为分布是否正确。
阅读全文视频生成模型可以拍出看似合理的未来,但这并不意味着它理解了同一条件下可能发生的多种结果。PAWBench 将评测重点从单条视频的 plausibility 推向行为分布是否正确。
阅读全文GameWAM 将世界模型与行动策略合并为一个闭环系统,能够根据游戏画面预测未来状态,并生成可执行的键鼠轨迹。它还探索了长时程控制和生成式动作模型中的低频偏置问题。
阅读全文新论文提出,世界模型的扩展不应只依赖更多网络视频,还需要能持续产生可靠奖励信号的数据引擎。游戏引擎提供的碰撞、物理和可导航性检查,或能为空间智能的强化学习后训练补上关键一环。
阅读全文Code World Model 试图解决视频世界模型难以维持长期状态和规则一致性的问题:由编码智能体管理世界状态,再由视频模型负责视觉呈现。
阅读全文EchoWM提出一种可进入式全模态世界模型,用户持续改变观察轨迹时,系统能够同步生成720p视频、环境音、音乐与语音。其核心是把离散指令和连续姿态统一到共享的相对6自由度轨迹中,并兼顾第一人称与第三人称场景。
阅读全文ReWorld 将短期动作控制与长期场景记忆分开训练,并在推理时通过有限 KV 缓存和基于位姿的地标检索控制计算量。论文还通过统一动作尺度、回环轨迹和蒸馏技术,让同一模型兼顾高质量生成与实时交互。
阅读全文一项系统性综述以传统模拟器的八项能力为标尺,评估世界模型从“生成看起来合理的世界”走向“可计算、可控制、可复现仿真”的进展与缺口。研究指出,状态反馈和长时程稳定性仍是关键短板。
阅读全文ForgeWM提出一套渐进式因果训练方案,将双向动作条件视频生成器转化为适用于交互游戏的少步世界模型。它在降低推理延迟的同时,试图保持键盘、鼠标和手柄动作与视频演化的一致性。
阅读全文WorldRover 提出一套基于虚幻引擎的合成数据引擎,将长时探索视频与深度、轨迹、光流和三维点跟踪等标注同步生成。它试图为需要持续建模、记忆和交互的世界模型提供更完整的训练数据。
阅读全文StateFlow 提出一种以“持久3D世界状态”为核心的生成式预演框架,用于电影、游戏、建筑和城市设计等场景。它不再把视频一次性生成完,而是先构建可编辑世界,再围绕状态演化和相机访问进行迭代。
阅读全文视频世界模型的问题不只在于“看起来像”,更在于长时间滚动后会不会偏离真实状态。WorldCycle 提出用可逆动作循环作为无需标注的监督信号,把“能否回到起点”变成训练目标。
阅读全文MiniWorld 试图把视频世界模型的训练门槛从“依赖大型预训练模型与复杂后训练”拉回到可复现的端到端流程。它面向具身智能与交互式模拟,强调因果流式推理、有限算力和开放代码。
阅读全文WCM 试图解决机器人 VLA 强化学习中的一个关键短板:在部分可观测环境下,critic 只看单帧或弱历史特征,难以准确评估动作价值。它通过联合预测未来潜在状态与估计价值,让 critic 学到更具时间结构的表示。
阅读全文Roomer 针对 3D 室内布局生成中的局部错误提出反思式修复框架,把碰撞、越界、开口遮挡和通行受阻等问题定位到具体物体,并在验证通过后才提交修改。
阅读全文WorldExam 提出一套面向可控视频世界模型的分层诊断基准,重点不只看画面质量和指令完成度,还要检验模型是否能根据场景状态产生合理反应。
阅读全文ODEWorld 将世界模型从“逐帧预测”转向“连续时间演化”,通过在潜空间中学习 ODE 速度场来描述物理动态。它的目标是在视频预测与机器人规划中,同时兼顾长期一致性、视觉重建质量和可用于决策的动态抽象。
阅读全文Hugging Face Daily Papers 收录的 Mental World Modeling 提出:只模拟物理场景不足以预测人的行动,模型还必须显式追踪信念、目标、情绪与社会约束等心理变量。
阅读全文QQWorld 关注潜在世界模型中一个容易被忽视的问题:潜在表示的分布尾部如果偏离高斯假设,规划性能可能受到影响。论文提出以分位数-分位数匹配替代 EP 正则,让尾部样本也能获得更有效的校正信号。
阅读全文World Labs收购机器人仿真公司SceniX,显示世界模型正从“生成可观看空间”转向“模拟行动后果”。物理AI的下一轮竞争,可能不只是数据规模,而是谁能构建更多可训练、可评测、可复用的虚拟世界。
阅读全文ShadowDancer 试图解决交互式视频世界模型的关键难题:如何把一个示范视频中的动作,可靠迁移到新的场景中。它通过“同一动态、不同外观”的视频配对,让模型学习更纯粹的动作表示。
阅读全文