記事一覧へ戻る
世界モデル

JEPA-TTT、世界モデルをテスト時に継続適応させる

読了目安 3 分

背景

世界モデルは、環境の未来状態を予測し、その予測を使って行動計画を立てる。しかし、訓練時と実運用時で摩擦や質量、アクチュエータの応答などが変わると、学習済みの遷移モデルは急速に不正確になる可能性がある。JEPA-TTTは、この問題に対して、事前学習済みの潜在世界モデルをテスト中も更新し続ける仕組みを提案する。

仕組み

JEPA-TTTの土台は、アクション条件付きのJEPA(Joint-Embedding Predictive Architecture)世界モデルだ。モデル全体を再学習するのではなく、環境変化の影響を受けやすい部分に更新を絞っている。

  • 潜在ダイナミクス予測器だけを更新:視覚エンコーダーを固定し、テストデータによって事前学習済みの視覚表現が崩れることを抑える。報酬ヘッドも固定し、元のタスク目的を維持する。
  • 自己教師ありで適応:エージェントが観測した後続状態を利用して予測を修正するため、オンライン報酬や目標画像を必要としない。
  • 密なリプレイを利用:軌跡から一部だけを取り出すのではなく、各時間オフセットで予測ウィンドウを作成し、成長するバッファーに保存する。更新時にはそこからミニバッチをサンプリングする。
  • エピソード間で経験を蓄積:各エピソード終了時に適応をリセットせず、テスト中に得た情報を継続利用する。

この設計では、視覚表現やタスクに関する既存知識を保ちながら、潜在空間における未来予測だけを新しい力学に合わせて調整できる。画像を完全に再構成する必要がない点も特徴だ。

結果と意味

評価は4つの連続制御環境と8種類のダイナミクス変化を対象に行われた。JEPA-TTTは、すべての変化条件で固定されたJEPA世界モデルを上回った。テストエピソード500回後には、自己回帰型の潜在予測誤差が平均83%減少し、計画性能は固定モデルに対して153%向上した。

この結果は、世界モデルを「一度学習したら固定して使う」ものから、運用中に校正し続けるものへ拡張できる可能性を示す。オンライン報酬がなくても、観測された状態と予測のずれを適応信号として利用できるからだ。一方で、古い経験と新しい経験をどう配分するか、環境が継続的に変化する場合に忘却をどう防ぐかなど、課題も残る。今回の評価は連続制御環境が中心であり、複雑な視覚タスクや開放的な環境への適用性は今後の検証が必要だ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
RealtimeWAM:世界行動モデルを1ステップ・非同期推論へ
世界モデル
cctest.ai
世界モデル

RealtimeWAM:世界行動モデルを1ステップ・非同期推論へ

RealtimeWAMは、世界行動モデルにおける多段階の行動デノイズと、動画エキスパートと行動エキスパート間の待ち時間を同時に削減する。論文では、H100上で最大25倍のエンドツーエンド高速化と、1%未満の精度低下が報告されている。

続きを読む
CCTest · Blog
HelixWorld、空間音響を備えたリアルタイム世界モデルを提案
世界モデル
cctest.ai
世界モデル

HelixWorld、空間音響を備えたリアルタイム世界モデルを提案

HelixWorldは、映像だけを生成する従来のインタラクティブ世界モデルに、カメラ位置に対応したステレオ音響を組み込む。視点やユーザー操作に応じて映像と音場を同時に変化させ、音響的一貫性を評価するベンチマークも導入した。

続きを読む
CCTest · Blog
World Embedding Benchmark、動画モデルの物理理解を検証
世界モデル
cctest.ai
世界モデル

World Embedding Benchmark、動画モデルの物理理解を検証

World Embedding Benchmarkは、動画埋め込みが物理概念と正しく対応し、定量的な情報を保持しているかを評価する。実験は、物理信号が表現内に存在することと、それを他モダリティで利用できることが別問題であると示した。

続きを読む