記事一覧へ戻る
推論・デプロイ

CARE、視覚言語行動モデルの高速化に統計的な安全弁を導入

読了目安 3 分

背景

視覚、言語、行動を一体化するVLAモデルは、ロボットが指示を理解し、環境を見ながら操作するための有力な基盤になりつつあります。一方、制御ステップごとに大規模モデルを実行すると、計算コストと遅延が大きくなります。アクションチャンク、視覚トークンの削減、生成ステップ数の削減などは有効な高速化手段ですが、重要な情報まで失わせる可能性があります。

この問題は平均値だけでは見えにくいものです。高速化方策が多くのタスクで動作しても、元の方策なら成功した少数のタスクを壊しているかもしれません。さらに閉ループ制御では、初期の小さな行動差が後続ステップで蓄積し、失敗がエピソードの終端まで現れないことがあります。

CAREの仕組み

  • 高速化による固有の失敗を切り分ける。 参照方策が成功し、高速化方策が失敗したケースだけを高速化誘発失敗として数えます。両方が失敗するケースとは区別されます。
  • 同じ条件でペア評価する。 同一の初期状態から両方の方策を実行し、完全なエピソードの終端結果を比較します。内部構造に依存しないため、異なる高速化方式にも適用できます。
  • 統計的に認証する。 校正セットで有限標本の検定を行い、失敗リスクが利用者の指定した予算以下かを確認します。合格する候補がなければ、参照方策へ戻します。
  • 評価コストを抑える。 序次検定により判定に十分なデータが集まった時点で評価を止め、加速方策が失敗した場合に参照方策の実行を追加することで、不要な比較を減らします。

結果と意義

OpenVLA-OFTを4つのLIBEROスイートで評価した結果、CAREは9.0~10.8倍の高速化を認証し、95%の信頼水準で、参照方策が解けたエピソードの少なくとも85.8%を維持できると保証しました。厳しいリスク予算では、保証を持たない選択器が試行の最大75%で予算を超えた一方、CAREは制約内にとどまりました。序次版は全候補を網羅的に評価する方法と比べ、rollout数を78.9%削減しています。さらに、pi0.5のflow-step削減、CrafterのQwen3.5-9BとLlama-3.1-8Bにも適用されています。

この研究の重要性は、高速化を単なる速度競争ではなく、リスク制約付きの選択問題として捉え直した点にあります。実機ロボットでは、平均成功率だけでなく、元の能力を失わせないこと、失敗リスクを説明できることが重要です。ただし保証は、校正データ、初期状態の分布、終端成功判定の妥当性に依存します。CAREは絶対的な安全証明ではなく、導入前に高速化手法を選ぶための統計的なゲートとして理解するのが適切です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SparseDecoding、生成段階に適応したLLM枝刈りを提案
推論・デプロイ
cctest.ai
推論・デプロイ

SparseDecoding、生成段階に適応したLLM枝刈りを提案

SparseDecodingは、自然文で作成した校正データと実際の生成時の分布が異なる問題に着目する。生成中の活性値を使った枝刈りとN:M疎行列ベクトル積カーネルにより、A100上で最大1.48倍のエンドツーエンド解码高速化を報告した。

続きを読む
CCTest · Blog
TokenRouter:トークン単位のLLMルーティングを支える推論基盤
推論・デプロイ
cctest.ai
推論・デプロイ

TokenRouter:トークン単位のLLMルーティングを支える推論基盤

TokenRouterは、生成中のトークンごとにモデルを切り替えるLLMルーティング向けのサービングシステムです。非同期のモデル別サーバーと遅延バッチ処理により、実行ステップのずれやバッチ投入の遅延に対応します。

続きを読む
CCTest · Blog
SparseEngine、長文脈エージェント向けに疎な推論を中心とした設計を提案
推論・デプロイ
cctest.ai
推論・デプロイ

SparseEngine、長文脈エージェント向けに疎な推論を中心とした設計を提案

SparseEngine は、異なる KV キャッシュ方式を長文脈 LLM エージェントの推論基盤に組み込みやすくするための、疎性優先の推論エンジンです。論文では、スループットやデコード速度の向上に加え、リクエストをまたいだキャッシュ状態の管理を示しています。

続きを読む