記事一覧へ戻る
ロボティクス・フィジカルAI

StreamPI、単一フレームVLAモデルにストリーミング時系列推論を追加

読了目安 4 分

導入

視覚・言語・行動(VLA)モデルは、ロボットが指示を理解し、環境を観察し、操作を実行するための有力な構成になりつつある。一方で、先端モデルの一部は依然として単一フレームを中心に推論する。単一画像だけで判断すれば処理は比較的単純になるが、直前までの状態を保持しにくい。物体がどこにあったのか、前の動作で何が変化したのか、現在の見え方が自分の操作によるものなのかを判断するには、過去の観測が重要になる。

StreamPIは、この制約を解消するため、モデルのパラメータを増やさずに単一フレームVLAへストリーミング型の時系列モデリングを組み込む。新しい大規模な記憶モジュールを追加するのではなく、画像、指示、時間方向の情報をどのように並べ、どの範囲で注意を向けるかを再設計する点が特徴だ。

主なポイント

  • 指示を時系列のアンカーにする。 各フレームの視覚観測と言語指示を一つの基本単位として扱う。同じ単位の内部では双方向注意によって画像と言語を相互に融合し、異なる時刻の単位の間では因果注意を用いる。これにより、現在の状態は過去を参照できる一方、未来の情報を見ない自己回帰的なストリーミング推論が維持される。
  • タスクの意味を継続的に保持する。 指示は初回だけ条件として与えられるのではなく、各観測とともに時系列へ組み込まれる。そのため、過去と現在の視覚情報を、ロボットが達成すべき目標に照らして解釈し続けられる構成になる。
  • 不規則なタイミングを訓練に取り込む。 実環境ではカメラ、制御器、ロボットの動作が完全には同期しない。StreamPIは観測間隔を変えたストリーミング訓練を行い、さらに間隔をランダム化する。論文では、数フレームごとに観測するような適切な間隔が、より速く滑らかな動作につながり、ランダム化がタイミングの揺らぎへの頑健性を高めるとしている。
  • 単一フレームの重みを再利用できる。 LLMバックボーンの長さ外挿能力を利用し、事前学習済みの単一フレーム重みを引き継ぐ。用途に応じて単一フレーム推論と複数フレーム推論を切り替えられる点も実装上の柔軟性につながる。

意義と影響

StreamPIの重要性は、VLAに記憶を持たせる方法を、必ずしも大規模化や別モジュールの追加に限定していない点にある。単に画像を連結するのではなく、各時刻の内部で言語と視覚を融合し、時刻をまたぐ情報は因果的に流すことで、タスク指示と履歴を結び付けたまま処理する。

この設計は、遮蔽、状態変化、細かな位置合わせを伴う操作で役立つ可能性がある。現在の画像だけでは欠けている手掛かりを過去の観測から補い、指示を基準に必要な情報を選べるからだ。また、ランダム間隔訓練は実ロボット特有の問題にも対応する。入力が一定周期で届かない環境では、認識能力だけでなく、時間間隔の変動に対する頑健性も重要になる。

論文は、記憶を必要とする課題や精密な知覚を要する実ロボットタスク、さらにLIBEROシミュレーションベンチマークで評価し、幅広い課題でpi0.5を上回ったと報告している。ただし、提供された素材には成功率、課題数、計算コストなどの詳細は含まれていないため、改善幅は本文での確認が必要だ。

StreamPIは、既存の単一フレームVLAを活用しながら、構造化された時系列情報と非同期展開を意識した訓練を加える、比較的穏当な拡張案といえる。その示唆は、ロボットの記憶には長いコンテキストだけでなく、その中で言語目標を安定して維持する仕組みも必要だということだ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
GigaBrain-0.7、三システム構成で具現知能の汎化を拡張
ロボティクス・フィジカルAI
cctest.ai

GigaBrain-0.7、三システム構成で具現知能の汎化を拡張

GigaBrain-0.7は、視覚言語理解、世界予測、ロボット行動を結び付ける三システム構成を提案する具現知能モデルです。3万7,000時間超の異種データで事前学習し、異なるロボット本体やタスクへの汎化を目指します。

続きを読む
CCTest · Blog
WorldToken、時間を軸にロボット模倣学習を組み立てる
ロボティクス・フィジカルAI
cctest.ai

WorldToken、時間を軸にロボット模倣学習を組み立てる

WorldTokenは、各時刻のマルチビュー画像、固有感覚、タスク条件を1つのワールドトークンに統合し、時間方向の系列として処理する手法です。実験では、対象領域のデータ量と長い履歴コンテキストの重要性が示されました。

続きを読む
CCTest · Blog
PhysCaP、物体に触れて物理特性を推定するロボット操作エージェント
ロボティクス・フィジカルAI
cctest.ai

PhysCaP、物体に触れて物理特性を推定するロボット操作エージェント

PhysCaPは、コード・アズ・ポリシー型のロボットに物理情報に基づく能動探索を加える手法です。ロボットは視覚だけに頼らず、身体感覚から物体の重さや硬さを推定し、必要な場合だけ追加の操作を行います。

続きを読む