記事一覧へ戻る
強化学習

VLA強化学習の更新が低ランクになる理由

読了目安 3 分

導入

視覚・言語・行動(VLA)モデルでは、模倣学習の後に強化学習を適用して性能を高める流れが広がっている。一方で、強化学習がポリシーの内部をどのように変えるのかは、まだ十分に理解されていない。HOLI-LABの研究は、最終的な成功率だけでなく、学習後のパラメータ更新がどこに現れるかを調べた。

主な発見

対象となったのは、π_{0.5}やGR00T N1.5/N1.6などのフローベースVLAモデルである。LIBERO、ManiSkill、MetaWorld、CALVINを用いた分析から、次の傾向が得られた。

  • 更新は低ランクだった。 モデル全体のパラメータ数に比べ、強化学習による実質的な変化は限られた方向に集中していた。
  • Timestep Modulesが重要だった。 これはアクションエキスパート内の小規模な構成要素で、これまで十分に注目されていなかった。モジュール置換実験では、RLによる性能向上の大きな部分を担っていることが示された。
  • 離散デノイジング時刻が鍵になった。 ロールアウトで使われる特定の時刻に合わせてモジュールが特化し、それが低ランク更新の形成に関係すると分析された。
  • shiftベクトルの変化が目立った。 モジュールの出力の中でもshiftベクトルの更新が最も明確で、更新方向はタスク成功を強く予測した。報告されたROC-AUCは最大99.6%に達する。
  • 更新方向はタスク関係も表した。 shift更新同士の類似度は、タスク間の転移パターンと相関した。

意義と限界

この研究が示すのは、VLAの強化学習がモデル全体を一様に書き換えるのではなく、行動生成に関わる少数の方向を調整している可能性である。対象となるパラメータを絞れれば、将来のポストトレーニングを低コスト化し、学習による変化を解釈しやすくできる。

さらに、学習済みのshift更新方向に沿ってポリシーを誘導することで、追加の強化学習なしに性能を改善できることも示された。これはRLの代替ではなく、RLで得た更新方向をポリシー編集やタスク転移に再利用する考え方である。

ただし、実験はフローベースのVLA、離散的なデノイジング設定、複数のシミュレーション環境に基づく。別の行動生成方式や連続時間設定、実ロボットでも同じ構造が現れるかは今後の課題だ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
オンライン方策蒸留のスケーリング:小さな教師で大規模モデルを導く
強化学習
cctest.ai
強化学習

オンライン方策蒸留のスケーリング:小さな教師で大規模モデルを導く

オンライン方策蒸留が、異なる規模のモデル間で推論能力をどのように移転するかを体系的に分析した研究です。小型の強化学習モデルでも大きな学生モデルを改善でき、教師の規模やスコアだけでは指導価値を説明できないことが示されました。

続きを読む
CCTest · Blog
LLM強化学習の学習・推論ミスマッチをCISで補正
強化学習
cctest.ai
強化学習

LLM強化学習の学習・推論ミスマッチをCISで補正

RLVRでは、ロールアウトを生成する推論エンジンと勾配を計算する学習エンジンが、同じトークンに異なる確率を割り当てることがあります。新手法CISは、トークンの信頼度を考慮した重要度サンプリングで、この差による更新誤差を抑えます。

続きを読む