返回文章列表
世界模型

用扩散语言模型做文本世界模型:Agent 强化学习的新模拟器路线

阅读约 3 分钟

导语

Agent 强化学习正在遇到一个越来越现实的瓶颈:真实或手工设计的训练环境不够多、不够细,也不够难。随着模型能力提升,固定任务和固定奖励很快会失去训练信号;而长链路任务中的稀疏奖励,又容易让模型只学会少数工作流或工具调用模板。于是,“世界模型”重新变得重要:如果模型能模拟环境状态转移,就有机会按需生成更丰富的训练场景。

这篇论文讨论的核心问题是:文本世界模型是否必须沿用自回归语言模型?作者认为未必。自回归模型按从左到右生成文本,天然容易先生成局部内容,再被后续上下文“追着修正”。但在 Agent 环境里,状态往往要同时满足多个全局锚点,例如工具 schema、之前对话、领域规则和目标结果。论文提出,Masked Diffusion Language Models(MDLMs)通过双向、锚点感知的去噪过程,更适合做可控的文本世界模拟器。

核心要点

  • 问题重构:论文将文本世界建模形式化为“可控状态转移动力学”,并拆分为初始状态、任务上下文、工具 schema、领域规则和 steering directives 等组成部分。
  • 数据规模:作者整理了 239,403 条 grounded state-action 轨迹,覆盖九个开源环境和十二个前沿模型家族,用于比较不同世界模型路线。
  • 模型对比:与自回归语言模型相比,MDLM 在 coherence、groundedness 和经验证的 rollout diversity 上表现更好;论文还指出,其效果超过参数量大 4 倍以上的 LLM,同时推理延迟相近。
  • 训练框架:研究引入了可插拔的 GRPO 训练框架,并结合 deterministic state checks,降低模拟环境中状态漂移对强化学习训练的影响。
  • 迁移结果:在 ScienceWorld、ALFWorld、AppWorld 三个分布外环境上,作者对 LFM2.5、Qwen3、Mistral 等 1.2B-7B Agent 骨干进行了零样本迁移消融,报告最高可获得 47% 的绝对提升,且不需要环境特定微调。

意义与影响

这项工作的重要性不只在于“扩散语言模型又赢了一项指标”,而在于它挑战了文本世界模型默认使用自回归生成的范式。Agent 训练环境和普通文本生成不同:它要求模拟器长期保持状态一致,遵守工具约束,并根据预期目标生成合理后果。若模型只能顺序生成,越长的 rollout 越可能积累偏差。

MDLM 的双向去噪机制,为这种场景提供了另一种生成路径:先围绕全局锚点进行条件约束,再逐步补全状态细节。这可能让未来的 Agent RL 更依赖“可操控模拟器”,而不是昂贵、有限且难以扩展的人工环境。不过,论文结果仍主要建立在特定开放环境和所构建轨迹集上,能否推广到更复杂的真实工具生态、多人交互或高风险任务,还需要更多验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
UniWorld-View登顶WorldScore:国产世界模型如何从一张图生成可控新视角视频
世界模型
cctest.ai
世界模型

UniWorld-View登顶WorldScore:国产世界模型如何从一张图生成可控新视角视频

兔展智能联合北大、鹏城实验室推出的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,并已开源代码与权重。它的关键看点在于:用统一模型处理单图 3D 与视频 4D 新视角生成,并强化相机位姿控制。

阅读全文