記事一覧へ戻る
世界モデル

Masked Diffusion LMはAgent強化学習向けの新しいテキスト世界モデルになるか

読了目安 3 分

導入

Agent向けの強化学習では、環境そのものがボトルネックになりつつある。手作業で作られた環境は数も難度も限られ、モデルが強くなるほど訓練信号として弱くなる。さらに、長いタスクで報酬が疎になると、Agentは特定の手順やツール利用パターンに偏りやすい。そこで注目されるのが、環境状態をシミュレートして多様な訓練ロールアウトを生成する世界モデルだ。

この論文の問いは、テキスト世界モデルに自回帰言語モデルを使い続けるべきか、という点にある。自回帰モデルは左から右へ順番に生成するため、通常の文章生成には適している。しかしAgent環境では、次の状態が単なる文ではなく、ツールスキーマ、過去の会話、ドメインルール、期待される結果と同時に整合していなければならない。著者らは、双方向にノイズ除去を行うMasked Diffusion Language Models(MDLMs)が、この種のグローバルな制約により適していると見る。

核心ポイント

  • 問題設定の整理:テキストベースの世界モデリングを、制御可能な状態遷移ダイナミクスとして定式化。初期状態、タスク文脈、ツールスキーマ、ドメインルール、steering directivesに分解して扱う。
  • データ構築:9つのオープンソース環境と12のフロンティアモデルファミリーにまたがる、239,403件のgrounded state-action軌跡を整備した。
  • モデル比較:MDLMは、双方向かつアンカーを意識したdenoisingにより、一貫性、groundedness、実証的に確認されたrollout diversityで、自身より4倍以上大きい自回帰LLMを上回ったとされる。推論レイテンシは同程度と報告されている。
  • 訓練フレームワーク:決定的な状態チェックを組み込んだプラグイン型のGRPO訓練フレームワークを導入し、シミュレーション中の状態崩れを抑える設計にしている。
  • 転移評価:ScienceWorld、ALFWorld、AppWorldの3つのOOD環境で、LFM2.5、Qwen3、Mistralを含む1.2B〜7B規模のAgentバックボーンを評価。環境固有の微調整なしで、最大47%の絶対改善が報告された。

意義と影響

この研究の意義は、拡散型言語モデルが単に別の指標で強かったという点にとどまらない。重要なのは、Agent用の世界モデルでは、生成順序そのものが性能を左右しうるという示唆だ。環境状態は複数の制約を同時に満たす必要があり、逐次生成では長いロールアウトほど矛盾が蓄積しやすい。

MDLMの双方向denoisingは、まず全体の制約を保ちながら状態を補完するという発想に近い。そのため、ツール利用や過去履歴との整合性が重要なAgent訓練では、自回帰モデルより扱いやすい可能性がある。

一方で、結果は特定のオープン環境と構築された軌跡データに基づく。より複雑な実ツール環境、長期運用タスク、高リスク領域でも同じ利点が出るかは今後の検証が必要だ。それでも、テキスト世界モデルの設計を見直す有力な方向性を示した研究と言える。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
GE-Act 2.0、ロボット向け世界行動モデルの事前学習と拡張を検証
世界モデル
cctest.ai
世界モデル

GE-Act 2.0、ロボット向け世界行動モデルの事前学習と拡張を検証

GE-Act 2.0は、事前学習済みの動画生成器に依存せず、マニピュレーションデータから世界行動モデルを学習する。訓練データを拡大することで、未知の環境や異なるロボット本体でのゼロショット操作性能が向上する可能性を示した。

続きを読む
CCTest · Blog
WorldSculpt:単一物体の3D生成先験で構成可能な世界を作る
世界モデル
cctest.ai
世界モデル

WorldSculpt:単一物体の3D生成先験で構成可能な世界を作る

WorldSculptは、単一物体向けの3D生成先験を、姿勢付きの多視点動画へ拡張する手法です。激しい遮蔽がある、数百物体規模の複雑なシーンを、共有された世界座標系内の個別メッシュとして再構成します。

続きを読む
CCTest · Blog
世界モデルを訓練後に外すと、なぜロボットは強くなるのか
世界モデル
cctest.ai
世界モデル

世界モデルを訓練後に外すと、なぜロボットは強くなるのか

光象科技と清華大学の研究チームは、世界モデルをロボットの実行時には使わず、訓練中の動作結果の評価に限定するActEffectを提案した。訓練時に多く考え、実行時は軽く動かす設計である。

続きを読む