PAWBenchが問う、動画生成モデルは確率まで再現できるのか
動画生成モデルがもっともらしい未来を1つ描けても、同じ観測と行動から生じうる複数の結果を理解しているとは限りません。PAWBenchは、反復生成によって正しい行動分布を再現できるかを評価します。
続きを読む動画生成モデルがもっともらしい未来を1つ描けても、同じ観測と行動から生じうる複数の結果を理解しているとは限りません。PAWBenchは、反復生成によって正しい行動分布を再現できるかを評価します。
続きを読むGameWAM は、ゲーム画面の未来予測と実行可能なキーボード・マウス軌跡の生成を一つの閉ループに統合します。長期タスクの再計画に加え、生成アクションに生じる方向バイアスも分析します。
続きを読む新しい論文は、世界モデルの拡張にはウェブ動画の追加だけでなく、根拠のある報酬信号を継続的に生む仕組みが必要だと論じています。ゲームエンジンは、空間モデルの強化学習後学習に実行可能な環境と長期軌跡を提供できる可能性があります。
続きを読むCode World Modelは、持続的な世界状態の管理をコーディングエージェントに、視覚的な描画を動画モデルに分担させるフレームワークです。
続きを読むEchoWMは、ユーザーがシーン内を継続的に移動できる「入り込める」生成メディア向けの全モーダル世界モデルです。移動に応じて、720p映像、環境音、音楽、音声を一体的に生成します。
続きを読むReWorldは、短期的な行動制御と長期的なシーン記憶を学習時に分離し、推論時には容量を制限したKVキャッシュとカメラ姿勢に基づくランドマーク検索を組み合わせます。無限に増える文脈を避けながら、再訪した場所の情報を呼び戻す設計です。
続きを読む従来型シミュレーターの八つの能力を基準に、世界モデルの到達点と課題を整理した調査が発表された。相互作用と制御では進展が見られる一方、物理法則の保証、状態フィードバック、長期的な再現性には大きな隔たりが残る。
続きを読むForgeWMは、双方向の動作条件付き動画生成器を、ゲーム操作に対応した少ステップの因果ワールドモデルへ変換する段階的な学習手法です。低遅延生成と、入力操作と映像の整合性を両立することを狙います。
続きを読むWorldRover は、Unreal Engine を基盤に、長時間の探索経路と幾何・動き・対応関係の注釈を同時に生成するデータエンジンです。環境を維持・再訪できる世界モデルの学習を支えることを狙います。
続きを読むStateFlow は、映画、ゲーム、建築、都市設計向けの生成型プリビジュアライゼーションを、永続的な3D世界状態として扱う枠組みです。動画を一度に生成するのではなく、構築・進化・アクセス可能な編集用ワールドを中心に据えます。
続きを読む動画世界モデルは見た目が自然でも、長いロールアウトでは状態がずれていきます。WorldCycle は可逆な動作循環を自己検証可能な学習信号に変え、「元の状態に戻れるか」を最適化します。
続きを読むMiniWorld は、大規模な事前学習済み動画生成モデルの改造に頼らず、動画ワールドモデルをエンドツーエンドで訓練するための再現可能な枠組みを目指す。焦点は、因果的なストリーミング推論、限られた計算資源、そして公開された実装にある。
続きを読むこの論文は、世界モデルを「エージェント中心の対話的プロキシ」として捉え直し、物理状態の予測だけでなく、行動・学習・継続的改善に役立つ情報フィードバックを重視する。
続きを読むWCMは、ロボット向けVLAモデルの強化学習後処理で問題になる価値推定の弱点に焦点を当てている。単一フレームに依存するcriticでは部分観測性に対応しにくく、未来の潜在状態予測を組み合わせることで時系列構造を学ばせる。
続きを読むRoomer は、生成された 3D 室内レイアウトに残る衝突、境界外配置、開口部の遮蔽、動線の阻害を、具体的な物体にひも付けて局所的に修復する枠組みです。
続きを読むWorldExam は、制御可能な動画生成モデルを世界モデルとして評価するための階層型ベンチマークです。画質や指示追従だけでなく、場面の状態に応じて世界が自然に反応できるかを検証します。
続きを読むODEWorld は、固定ステップの未来予測ではなく、物理時間に沿って変化する潜在速度場を学習する世界モデルです。任意の時間解像度での予測、逆方向予測、ロボット計画に役立つ動的表現を狙っています。
続きを読むMental World Modeling は、物理的な場面を正しく再現できる世界モデルでも、人の信念や意図を追跡しなければ行動予測を誤ると主張する研究です。
続きを読むQQWorld は、潜在世界モデルにおける分布の裾の制御に注目した研究です。Epps-Pulley 目的を分位点-分位点マッチングに置き換えることで、裾のサンプルにも有効な補正勾配を与えることを狙います。
続きを読むWorld Labsによるロボットシミュレーション企業SceniXの買収は、世界モデルが見た目の生成から行動結果のシミュレーションへ向かっていることを示している。物理AIでは、どれだけ有用な訓練世界を作れるかが重要になりつつある。
続きを読むShadowDancer は、デモ動画に含まれる行動を新しい環境へ移すための手法です。同じ動きで見た目だけが異なる動画ペアを使い、外観に依存しない動的表現を学習します。
続きを読む