D-JEPA、潜在世界モデルを実行結果に沿った意思決定へ
導入
潜在世界モデルは、現在の状態に行動を加えたときの未来を潜在表現として予測し、目標に近い未来を生む行動を選ぶ。ところが、潜在空間での距離が「見た目の予測の近さ」を表していても、それが「実際に成功する可能性の高さ」と一致するとは限らない。実行可能な候補が数個に絞られる場面では、目標に近く見える予測が、別の候補より悪い結果につながることもある。
D-JEPA(Decision-Aligned Latent World Model)は、この意思決定局所の予測ギャップに取り組む手法だ。既存の予測モデルを全面的に作り直すのではなく、行動を実行した後の結果から、候補同士をどう比較すべきかを学習する。
主な仕組み
- 予測の正確さから選択の妥当性へ。 すべての未来を一様に評価するのではなく、現在の意思決定で競合する候補間の関係に焦点を置く。
- 序列情報を利用。 実行結果から、どの候補が相対的に良かったかというordinal evidenceを得て、目標との関係を示す予測特徴と組み合わせる。
- 限定的な幾何補正。 有界かつ候補の並び替えに対して同変な演算子により補正を行い、事前学習済みモデルの予測能力を保ちながら、選択に重要な部分だけを調整する。
- 異なる予測幾何を接続。 共有された序列インターフェースを使い、相補的な予測表現の間でも意思決定の整合を広げる。
- 従来の計画法と互換。 学習した構造はJEPA互換の未来表現として実現されるため、導入後も潜在距離に基づく計画を利用できる。
結果と影響
提供された素材によると、評価は潜在制御、マニピュレーション、事前学習済みの行動生成モデル、実ロボット、自動運転にまたがる。PushTの確認評価では成功率87.89%、RoboTwinでは平均15.04ポイント、実ロボットタスクでは17ポイントの向上が報告された。これは、世界モデルの価値が未来を精密に描くことだけでなく、その予測を行動選択に適した順序で比較できることにもあると示している。
ロボットや車両は、時間と計算資源の制約下で限られた候補から選ばなければならない。潜在距離の順位が誤っていれば、予測器が高性能でも制御結果は悪化しうる。D-JEPAは、実行フィードバックを使ってこの局所的な順位を修正する考え方を提示する一方、効果は教師データ、候補生成方法、基盤モデルの幾何にも左右される。したがって、万能な置き換えというより、予測と制御の間を埋める実践的な補正機構と捉えるのが適切だ。
Source: Hugging Face Daily Papers
コメント
ログイン状態を確認中…
コメントを読み込み中…