記事一覧へ戻る
世界モデル

D-JEPA、潜在世界モデルを実行結果に沿った意思決定へ

読了目安 3 分

導入

潜在世界モデルは、現在の状態に行動を加えたときの未来を潜在表現として予測し、目標に近い未来を生む行動を選ぶ。ところが、潜在空間での距離が「見た目の予測の近さ」を表していても、それが「実際に成功する可能性の高さ」と一致するとは限らない。実行可能な候補が数個に絞られる場面では、目標に近く見える予測が、別の候補より悪い結果につながることもある。

D-JEPA(Decision-Aligned Latent World Model)は、この意思決定局所の予測ギャップに取り組む手法だ。既存の予測モデルを全面的に作り直すのではなく、行動を実行した後の結果から、候補同士をどう比較すべきかを学習する。

主な仕組み

  • 予測の正確さから選択の妥当性へ。 すべての未来を一様に評価するのではなく、現在の意思決定で競合する候補間の関係に焦点を置く。
  • 序列情報を利用。 実行結果から、どの候補が相対的に良かったかというordinal evidenceを得て、目標との関係を示す予測特徴と組み合わせる。
  • 限定的な幾何補正。 有界かつ候補の並び替えに対して同変な演算子により補正を行い、事前学習済みモデルの予測能力を保ちながら、選択に重要な部分だけを調整する。
  • 異なる予測幾何を接続。 共有された序列インターフェースを使い、相補的な予測表現の間でも意思決定の整合を広げる。
  • 従来の計画法と互換。 学習した構造はJEPA互換の未来表現として実現されるため、導入後も潜在距離に基づく計画を利用できる。

結果と影響

提供された素材によると、評価は潜在制御、マニピュレーション、事前学習済みの行動生成モデル、実ロボット、自動運転にまたがる。PushTの確認評価では成功率87.89%、RoboTwinでは平均15.04ポイント、実ロボットタスクでは17ポイントの向上が報告された。これは、世界モデルの価値が未来を精密に描くことだけでなく、その予測を行動選択に適した順序で比較できることにもあると示している。

ロボットや車両は、時間と計算資源の制約下で限られた候補から選ばなければならない。潜在距離の順位が誤っていれば、予測器が高性能でも制御結果は悪化しうる。D-JEPAは、実行フィードバックを使ってこの局所的な順位を修正する考え方を提示する一方、効果は教師データ、候補生成方法、基盤モデルの幾何にも左右される。したがって、万能な置き換えというより、予測と制御の間を埋める実践的な補正機構と捉えるのが適切だ。

Source: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
WorldPlay2、分解型制御と圧縮メモリで対話型世界モデルを拡張
世界モデル
cctest.ai
世界モデル

WorldPlay2、分解型制御と圧縮メモリで対話型世界モデルを拡張

WorldPlay2は、リアルタイムの操作性と長期ロールアウトの一貫性を両立することを目指す対話型世界モデルです。フレームに対応した行動制御、構造化された意味制御、共有メモリトークン、Stable Forcing蒸留を組み合わせています。

続きを読む
CCTest · Blog
InternW0-Δ:2万時間超のオープンデータで視覚予測とロボット行動を統合
世界モデル
cctest.ai
世界モデル

InternW0-Δ:2万時間超のオープンデータで視覚予測とロボット行動を統合

InternW0-Δは、視覚ダイナミクス、シーン意味論、4Dの幾何・運動事前分布、ロボット行動生成を一体化するWorld Action Modelです。論文では、シミュレーションと実ロボットの評価で従来手法を上回ったと報告しています。

続きを読む