Spatial-Interactor:相互作用から空間推論を学ぶVLMフレームワーク
導入
視覚言語モデルがシーン内の物体を認識できても、それだけで物理世界を理解したとは言えない。実際に行動するには、物体を動かした後に何が変わったのか、視点の移動によってどの関係が見えなくなったのか、複数の操作を終えた時点でシーンがどの状態にあるのかを追跡する必要がある。Spatial-Interactorは、この動的な空間推論を学習するための枠組みである。
静的な関係から状態遷移へ
従来の空間学習は、静止画像について物体の属性を答えたり、二つの物体の左右・前後・距離を判定したりする課題が中心だった。こうした課題は空間概念の形成に役立つ一方、行動によって状態がどう変わるかを直接教える信号は限られている。
Spatial-Interactorは、相互作用軌跡そのものを学習信号として利用する。行動前の観察、実行した行動、行動後の観察を一つの局所的な状態遷移として扱い、複数の遷移をつなげることで、モデルがフレームごとに独立して判断するのではなく、軌跡全体の依存関係を学べるようにする。
三段階のカリキュラム
学習は次の三段階に整理される。
- L1:受動的な世界状態の遷移。 物体の移動、シーンの変化、視点の変化による外部世界の更新を学ぶ。
- L2:能動的な自己状態の遷移。 自身の行動や視点変更が、その後の観察にどのような変化を与えるかをモデル化する。
- L3:長期の相互作用軌跡。 連続する局所遷移を統合し、長い操作列の中で空間状態を維持する。
この目的に合わせ、研究チームはシミュレーション環境と実際の相互作用軌跡からLSI-108Kデータセットを構築した。課題は、局所的な遷移理解から長期軌跡の統合まで、各レベルに対応している。
二段階の訓練
L1とL2では、教師ありファインチューニングによって局所的な状態遷移を学習させる。その後の長期推論では、オンポリシー蒸留を利用する。特権情報を持つ教師ブランチが区間ごとの遷移記述を受け取り、学生モデルが自身の方策で生成する思考連鎖を監督する仕組みだ。これにより、単発の説明を増やすのではなく、連続した変化を一貫した空間更新として統合することを目指す。
意義と残された課題
本研究の意義は、具身空間推論を「相互作用を通じた状態の維持」として捉え直した点にある。観察・行動・再観察のループを訓練の中心に置くことで、視覚理解と物理世界での行動の間に、より明確な接続を作ろうとしている。論文によれば、複数のVLMと空間ベンチマークで、局所遷移のモデル化と長期統合に一貫した改善が確認された。
一方、提供された情報には詳細なスコア、モデル規模の比較、実ロボットへの配備結果は含まれていない。そのため現段階では、一般的な物理世界モデルを完成させた手法というより、動的な空間推論に向けた訓練設計として評価するのが妥当だろう。
コメント
ログイン状態を確認中…
コメントを読み込み中…