Zetta、ロボットの実行中の復旧と自己進化を可能にする閉ループ基盤
導入
物理環境で動くロボットにとって、計画を立てることよりも、実行中に変化へ追随することのほうが難しい場合があります。把持に失敗したり、物体がずれたり、経路がふさがれたりすると、開始時には妥当だった行動列がすぐに通用しなくなります。しかし従来の具現エージェントの多くは、ロールアウト中は固定されたスキルを使い続け、エピソードが終わってから結果を分析します。これは、物理状態の変化に対する反応を遅らせる構造です。
Zetta は、反省を事後処理から実行ループの内部へ移すことを目指します。基盤ポリシー自体は凍結したまま、コードとして表現された実行時クリティックと復旧スキルをオンラインで進化させます。つまり、失敗のたびに基盤モデルを再学習するのではなく、その周囲のハーネスが状態を監視し、問題を検出し、再利用可能な復旧ロジックを蓄積します。
三つのループによる分担
Zetta は、制御と学習を異なる時間スケールのループに分けます。
- 行動頻度のガバナンス:ロボットと環境の状態を高い頻度で監視し、現在の行動が適切かを判断します。状態が変わった場合には、実行中に介入できます。大型エージェントモデルが連続的に処理しにくい高速な物理相互作用を補う層です。
- ロールアウト単位の提案:ロールアウト後に実行過程を分析し、クリティックが失敗パターンを特定します。そのうえで、復旧スキルや実行ロジックの修正案を作成します。
- 検証ゲート付き更新:提案されたスキルを直ちに採用するのではなく、検証を通過したものだけを再利用可能なスキルとして登録します。単一の誤った経験が将来の動作へ広がることを抑える考え方です。
即時の制御、エピソード後の診断、長期的な知識の蓄積を分離することで、それぞれに異なる速度と信頼性の要件を持たせています。
インフラも設計の一部
Zetta には、エージェントのロジックと異種実行リソースを切り離す Z-Infra も組み合わされています。具現知能の実験では、推論、シミュレーション、実ロボットの実行が異なるハードウェアや環境に分散することがあります。この分離により、多数のロールアウトを整理しやすくなります。
論文が示したロールアウト予算の範囲では、Zetta は LIBERO-Pro で 90.8%、RoboCasa で 93.6% の成功率を達成し、推論を 11.1 倍高速化したと報告されています。自己探索の経験が増えるにつれて成功率が伸び続け、学習したスキルはゼロショットで移転できるともされています。また、学習中にロボットの「Aha Moments」が現れると説明されています。
意義と今後の課題
Zetta の重要性は、物理知能のスケーリング方法を別の形で示した点にあります。新しい失敗に遭遇するたびに基盤ポリシーを変更するのではなく、クリティック、復旧スキル、検証規則からなる実行時層で改善を行います。安定した基盤を保ちながら、故障への耐性を高める道筋になり得ます。
一方、提供された情報だけでは、より多様な実環境、長時間運用、スキルライブラリの大規模化における安定性までは判断できません。失敗分布、検証コスト、異なるロボット間での一般化については、今後の追加検証が必要です。それでも Zetta は、固定的な実行手順を、監視され選択的に自己改善する閉ループへ変える具体的な設計を提示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…