記事一覧へ戻る
大規模言語モデル

GigaWorld-Policy-0.5:世界行動モデルをリアルタイム制御へ近づける試み

読了目安 3 分

導入

World Action Models(WAMs)は、ロボットの方策学習において注目されるアプローチの一つだ。単に「次にどの行動を取るか」を学ぶのではなく、行動と将来の視覚観測を同時に扱い、シーンがどのように変化するかを密な教師信号として利用する。これにより、物理世界に根ざした行動表現を獲得しやすくなる。

一方で、既存の WAM には実用上の課題がある。推論時に未来の動画を明示的に生成する設計では、計算コストが大きく、閉ループのロボット制御に必要な低遅延性を確保しにくい。GigaWorld-Policy-0.5 は、この問題に対して「訓練では未来を使い、推論では行動に集中する」という方向で改良を加えている。

主なポイント

  • 行動中心の設計:GigaWorld-Policy-0.5 は、GigaWorld-Policy の枠組みを発展させ、未来の視覚ダイナミクスを訓練時の学習信号として使う。一方、推論時には action-only decoding を採用し、未来映像を生成せずに行動を出力する。

  • AC-WM と WAM の混合訓練:事前訓練では、Action-Conditioned World Modeling(AC-WM)と WAM の訓練を組み合わせる。これにより、視覚的な変化とロボット行動の結び付きを強め、下流の方策学習へ転移しやすい行動表現を得ることを狙っている。

  • Mixture-of-Transformers による効率化:モデルは、視覚ダイナミクスのモデリングと行動生成を専門の Transformer エキスパートに分離する。行動だけが必要な推論時には、稼働する計算量を減らせる。概要では、ローカルの RTX 4090 環境で 85 ms の推論レイテンシを達成したとされている。

  • AutoResearch による設定探索:さらに、エージェントベースの AutoResearch パイプラインを用いて訓練設定を探索する。これにより、ハイパーパラメータ調整に必要な時間と手作業を減らし、より効率的に実験条件を見つけることを目指している。

意義と影響

この研究の重要点は、世界モデルを捨てることではない。むしろ、未来の視覚変化から得られる学習上の利点を残しながら、実行時の負荷を切り離そうとしている点にある。ロボット制御では、センサー入力、判断、実行が短い周期で繰り返されるため、推論時の余分な生成処理は大きな制約になり得る。

GigaWorld-Policy-0.5 は、未来映像を常に生成するのではなく、その理解を行動表現へ圧縮する方向を示している。もしこの考え方が多様なタスクや実機環境で有効であることが確認されれば、WAM をより実用的なロボット方策へ近づける一歩になるだろう。

ただし、提示された素材だけでは、詳細なベンチマークや比較条件、実機での挙動までは十分に判断できない。それでも、低遅延な制御と強い世界理解を両立させようとする設計思想は、今後の具身 AI 研究にとって重要な論点を示している。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
外部監督なしのオンポリシー自己蒸留:モデル自身の合意から学ぶ U-OPSD
大規模言語モデル
cctest.ai
大規模言語モデル

外部監督なしのオンポリシー自己蒸留:モデル自身の合意から学ぶ U-OPSD

本論文は、モデル自身の複数生成結果から擬似解を作り、それとの不一致を学習信号にする U-OPSD を提案する。真値ラベルや強い教師モデルを使わずに、数学推論ベンチマークで基盤モデルを安定して上回った点が特徴だ。

続きを読む
CCTest · Blog
解釈可能性は性能の代償ではない?Steerling-8B が示す透明な言語モデルの設計
大規模言語モデル
cctest.ai
大規模言語モデル

解釈可能性は性能の代償ではない?Steerling-8B が示す透明な言語モデルの設計

この技術レポートは、言語モデルの解釈可能性を学習後に付け足すのではなく、学習プロセスそのものに組み込むべきだと主張している。Steerling-8B は生成結果を入力、概念、学習データへ結び付ける試みとして紹介されている。

続きを読む
CCTest · Blog
SPOT:推論モデル蒸留を「結果で校正」する新手法
大規模言語モデル
cctest.ai
大規模言語モデル

SPOT:推論モデル蒸留を「結果で校正」する新手法

SPOT は、On-Policy Distillation において、どの位置を詳しく調べ、どの候補を学習目標にすべきかを同時に扱う手法です。教師モデルの局所確率だけでなく、検証器が評価した後続結果を使って蒸留ターゲットを調整します。

続きを読む