VLA強化学習の更新が低ランクになる理由
導入
視覚・言語・行動(VLA)モデルでは、模倣学習の後に強化学習を適用して性能を高める流れが広がっている。一方で、強化学習がポリシーの内部をどのように変えるのかは、まだ十分に理解されていない。HOLI-LABの研究は、最終的な成功率だけでなく、学習後のパラメータ更新がどこに現れるかを調べた。
主な発見
対象となったのは、π_{0.5}やGR00T N1.5/N1.6などのフローベースVLAモデルである。LIBERO、ManiSkill、MetaWorld、CALVINを用いた分析から、次の傾向が得られた。
- 更新は低ランクだった。 モデル全体のパラメータ数に比べ、強化学習による実質的な変化は限られた方向に集中していた。
- Timestep Modulesが重要だった。 これはアクションエキスパート内の小規模な構成要素で、これまで十分に注目されていなかった。モジュール置換実験では、RLによる性能向上の大きな部分を担っていることが示された。
- 離散デノイジング時刻が鍵になった。 ロールアウトで使われる特定の時刻に合わせてモジュールが特化し、それが低ランク更新の形成に関係すると分析された。
- shiftベクトルの変化が目立った。 モジュールの出力の中でもshiftベクトルの更新が最も明確で、更新方向はタスク成功を強く予測した。報告されたROC-AUCは最大99.6%に達する。
- 更新方向はタスク関係も表した。 shift更新同士の類似度は、タスク間の転移パターンと相関した。
意義と限界
この研究が示すのは、VLAの強化学習がモデル全体を一様に書き換えるのではなく、行動生成に関わる少数の方向を調整している可能性である。対象となるパラメータを絞れれば、将来のポストトレーニングを低コスト化し、学習による変化を解釈しやすくできる。
さらに、学習済みのshift更新方向に沿ってポリシーを誘導することで、追加の強化学習なしに性能を改善できることも示された。これはRLの代替ではなく、RLで得た更新方向をポリシー編集やタスク転移に再利用する考え方である。
ただし、実験はフローベースのVLA、離散的なデノイジング設定、複数のシミュレーション環境に基づく。別の行動生成方式や連続時間設定、実ロボットでも同じ構造が現れるかは今後の課題だ。
コメント
ログイン状態を確認中…
コメントを読み込み中…