返回文章列表
世界模型

GameWAM:让游戏智能体同时理解世界与行动

阅读约 3 分钟

导语

游戏智能体真正困难的地方,不只是“看懂画面”或“按下按键”,而是在持续变化的环境中预测后果、保持状态,并把计划转化为符合原生控制方式的连续动作。传统游戏智能体通常直接把视觉和任务信息映射成动作;交互式世界模型则更擅长预测“采取某个动作后会看到什么”,却未必能够自主完成任务。GameWAM 试图把这两条路线合并起来,提出面向电子游戏的 World-Action Model(WAM)。

核心设计

GameWAM 的关键不是单独增加一个预测模块,而是让视觉未来和行动轨迹在同一套生成式框架中协同建模。系统使用并行的视觉与动作扩散 Transformer 过程,在块因果条件下进行信息传递,并结合 flow matching,联合生成未来画面和可执行的键盘、鼠标轨迹。为支持这种训练,研究者构建了时间同步的游戏操作与 GUI 交互轨迹,使画面变化、用户意图和原生控制信号能够对应起来。

游戏中的控制类型并不统一:移动视角或鼠标光标是连续变化,键盘按键又带有离散属性,而且游戏操作和 GUI 操作的语义也不同。对此,GameWAM 在每个动作时间步预测当前属于 gameplay 还是 GUI 模式,再调用相应的动作分布;连续动作还经过归一化处理,以减少不同控制空间之间的差异。

长时间任务则采用 block-cycle 控制。模型会预测超出当前执行窗口的动作,但只提交其中较短的前缀;获得新的观察后,系统重新规划。细粒度的周期内上下文,以及分层保存的跨周期视觉历史,帮助模型在有限记忆预算下维持动作连续性,而不是每次重规划都从零开始。

实验与新问题

素材显示,GameWAM 在 Minecraft 和 ViZDoom 上取得了具有竞争力的闭环任务表现。在 Minecraft 的不同任务类别中,它相比对比智能体执行了更少的原生动作。不过,研究并未把生成式控制描述成没有缺陷的方案。论文进一步发现 Low-Frequency Action Source Imprinting(LASI):在条件固定时,采样动作源中的低频成分可能影响粗粒度的镜头运动;当这一偏差在重规划过程中反复保留时,可能积累为持续的方向性偏移。

意义与局限

GameWAM 的价值在于,它把“环境如何变化”和“下一步该怎么做”放进同一个建模问题中,提示游戏智能体可以从单纯的反应式策略走向预测式闭环控制。统一游戏输入与 GUI 操作,也为跨应用的原生交互提供了一个思路。与此同时,LASI 说明生成式动作策略不仅要评估成功率,还需要检查采样噪声、动作偏差和重规划稳定性。当前素材没有提供完整的模型规模、数据量和各项任务的具体数值,因此更适合将 GameWAM 视为一种有潜力的系统设计与问题发现,而非已经解决通用游戏控制的最终方案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
ReWorld:用分层注意力与地标记忆破解交互式世界模型的长程难题
世界模型
cctest.ai
世界模型

ReWorld:用分层注意力与地标记忆破解交互式世界模型的长程难题

ReWorld 将短期动作控制与长期场景记忆分开训练,并在推理时通过有限 KV 缓存和基于位姿的地标检索控制计算量。论文还通过统一动作尺度、回环轨迹和蒸馏技术,让同一模型兼顾高质量生成与实时交互。

阅读全文