Pelican-Sim 1.0、ロボット向け汎用ワールドモデルを構築
Pelican-Sim 1.0は、視覚コンテキストとロボットの行動から将来の観測を予測する、具現化知能向けの汎用シミュレーターです。統一行動空間、行動動画の注入、疎なMoE、少ステップ生成によって、異なるロボットへの制御性と生成効率を高めます。
続きを読むPelican-Sim 1.0は、視覚コンテキストとロボットの行動から将来の観測を予測する、具現化知能向けの汎用シミュレーターです。統一行動空間、行動動画の注入、疎なMoE、少ステップ生成によって、異なるロボットへの制御性と生成効率を高めます。
続きを読むWorld in World は、動画世界モデルを再学習せず、異なる視覚証拠を推論時に統合するインターフェースを提案する。視点変更、長時間の再訪、人物動作の転送を同じ仕組みで扱うことを目指す。
続きを読むRecursive Code World Models(RCWM)は、1枚の参照画像から複雑な3D世界を実行可能なコードとして再構成する手法です。全体・局所・全体の再帰ループにより、細部を調整しながらシーン全体の空間関係を維持します。
続きを読む自動研究エージェントの強化学習では、解を生成することよりも実験の実行がボトルネックになり得ます。WMRLは世界モデルで実行結果を予測し、バイアス補正とノイズ低減を組み合わせて学習を高速化します。
続きを読むProgrammable World Model は、インタラクティブ動画モデルが長時間のやり取りで世界の状態やルールを維持しにくい問題に取り組む。世界の状態変化を実行可能なプログラムで管理し、動画モデルは主に視覚的な描画を担う。
続きを読むOpenWAMは、世界モデルの知識を実行可能なロボット行動へ変換する研究を、モジュール化された実験基盤として整理する。制御実験を通じて、知識の移転、世界学習と行動学習の協調、身体データによる汎化を分析した。
続きを読むGE-Act 2.0は、事前学習済みの動画生成器に依存せず、マニピュレーションデータから世界行動モデルを学習する。訓練データを拡大することで、未知の環境や異なるロボット本体でのゼロショット操作性能が向上する可能性を示した。
続きを読むWorldSculptは、単一物体向けの3D生成先験を、姿勢付きの多視点動画へ拡張する手法です。激しい遮蔽がある、数百物体規模の複雑なシーンを、共有された世界座標系内の個別メッシュとして再構成します。
続きを読む光象科技と清華大学の研究チームは、世界モデルをロボットの実行時には使わず、訓練中の動作結果の評価に限定するActEffectを提案した。訓練時に多く考え、実行時は軽く動かす設計である。
続きを読むPuffin-Worldは、物理理解、空間シミュレーション、3D生成、シーン再構成を一つのマルチモーダル構成で扱うことを目指す。物理、深度、画像をネイティブなワールド状態として表現し、柔軟な視点移動を支えるOmni-Cameraを導入する。
続きを読むSolarWMは、異なる動画データ、生成バックボーン、長時間推論を分断してきた課題に取り組む。統一データ契約と3段階の学習レシピにより、5秒の学習クリップから分単位、さらには時間単位の対話的ロールアウトを目指す。
続きを読むZimaBlueは、人間とロボットの一人称動画をロボット制御へつなげる3段階の学習フレームワークを提案する。高容量の世界モデルと高速な行動予測を分離するSlow-Fast構成により、汎化性能とリアルタイム性の両立も目指す。
続きを読むH3-World は、33B の MiniMax-H3 動画生成モデルに、自然言語によるキャラクターとカメラの時間的に正確な制御を加える。専用のアクションモジュールを新設せず、既存の意味表現を軽量な LoRA 適応で活用する。
続きを読むWorld Labsは、画像、動画、カメラ姿勢、深度情報を同じ空間コンテキストで扱うマルチモーダル世界モデル「Atlas」を発表した。制御可能な視点生成だけでなく、ロボット向けのReal-to-Simも狙う。
続きを読む動画生成モデルがもっともらしい未来を1つ描けても、同じ観測と行動から生じうる複数の結果を理解しているとは限りません。PAWBenchは、反復生成によって正しい行動分布を再現できるかを評価します。
続きを読む新しい論文は、世界モデルの拡張にはウェブ動画の追加だけでなく、根拠のある報酬信号を継続的に生む仕組みが必要だと論じています。ゲームエンジンは、空間モデルの強化学習後学習に実行可能な環境と長期軌跡を提供できる可能性があります。
続きを読むGameWAM は、ゲーム画面の未来予測と実行可能なキーボード・マウス軌跡の生成を一つの閉ループに統合します。長期タスクの再計画に加え、生成アクションに生じる方向バイアスも分析します。
続きを読むCode World Modelは、持続的な世界状態の管理をコーディングエージェントに、視覚的な描画を動画モデルに分担させるフレームワークです。
続きを読むReWorldは、短期的な行動制御と長期的なシーン記憶を学習時に分離し、推論時には容量を制限したKVキャッシュとカメラ姿勢に基づくランドマーク検索を組み合わせます。無限に増える文脈を避けながら、再訪した場所の情報を呼び戻す設計です。
続きを読む従来型シミュレーターの八つの能力を基準に、世界モデルの到達点と課題を整理した調査が発表された。相互作用と制御では進展が見られる一方、物理法則の保証、状態フィードバック、長期的な再現性には大きな隔たりが残る。
続きを読むEchoWMは、ユーザーがシーン内を継続的に移動できる「入り込める」生成メディア向けの全モーダル世界モデルです。移動に応じて、720p映像、環境音、音楽、音声を一体的に生成します。
続きを読む