ロボットをプログラマーのように動かすPhysical Coding
導入
ロボットに物体をつかませ、指定された場所へ運ばせること自体は、すでに多くの研究で実現されています。しかし、物体の位置が変わったり、カメラの視点がずれたり、動作の途中で失敗したりした場合に、ロボットが状況を理解して計画を立て直せるかは別の問題です。現在の視覚・言語・行動モデル(VLA)や世界・行動モデル(WAM)は、観測と指示を直接ロボットの行動へ変換することが多く、訓練済みの分布から少し外れるだけでも性能が低下する可能性があります。
Hugging Face Daily Papersで紹介された研究は、この問題に対して「Physical Coding」を提案しました。デジタル環境のコーディングエージェントが、ツールを呼び出し、結果を確認し、コードを修正するように、物理世界のエージェントも状態と実行手順を明示的に扱うという発想です。
主な仕組み
- Code as World。 物体、物体間の関係、制約、作業の進捗を明示的に記録します。ロボットは単なる行動列ではなく、現在の状況を参照しながら判断できます。
- Code as Policy。 計画、行動、結果の検証、失敗からの復旧を、確認や変更が可能な手順として整理します。VLAやWAMは利用できますが、全判断を単独で担うのではなく、より大きなループの一部になります。
- Harnessによる接続。 HexaAnythingはHarnessを介して、知覚、計画、制御、外部評価のツールを組み合わせます。実行後のフィードバックを受けて、途中で方針を更新できます。
- 軌跡の再利用。 検証された実行軌跡は、学習データ、記憶、再利用可能なプログラムになります。これにより、ツール、データ、モデルを段階的に改善する可能性が生まれます。
実験結果と限界
RoboCasa365では、HexaAnythingのComposite-Unseen成功率が、ネイティブなXR-1 VLAの34.3%から38.3%へ、全体の成功率が56.6%から60.8%へ向上しました。Harnessで収集したデータを使って学習した27BのHexaModelは、報告されたすべてのデータ分割で基礎モデルを上回っています。評価には、ツールの改訂、シミュレーション上の科学実験、実ロボットでの実行も含まれます。PhyBenchと双腕のAgileXロボットでは、物理実験や大部分のテーブルトップ作業を自律的に完了し、公開比較より速い場合もありました。
ただし、これは完全な自己設計型ロボットを示す結果ではありません。現在の構成はHarness、外部評価器、利用可能なツールに依存しています。知覚の誤り、ツール呼び出しの不安定さ、長時間実行のコストは依然として課題です。モデル、ツール、タスク、ハードウェアを広く共進化させることも、今後の研究課題とされています。
意義
Physical Codingの意義は、ロボットの経験を不透明なモーター指令の流れとしてではなく、調査、修正、再利用できる表現として保存しようとする点にあります。この方向が発展すれば、ロボットは固定された方策を実行するだけでなく、状態を管理し、技能を呼び出し、結果を検証しながら経験を蓄積するエージェントに近づくでしょう。製造、家庭支援、科学実験のように、作業が長く環境が完全には固定されない分野で特に有効な考え方です。
コメント
ログイン状態を確認中…
コメントを読み込み中…