Pelican-Sim 1.0、ロボット向け汎用ワールドモデルを構築
導入
ロボットが現実環境で学習するには、多くの試行錯誤データが必要です。しかし、実機での反復は時間とコストがかかり、失敗によるリスクもあります。そこで、現在の視覚状態とロボットの行動から、次に観測される映像を予測するワールドモデルが、具現化知能の基盤として注目されています。Pelican-Sim 1.0は、複数のロボット形態、環境、タスクに対応する汎用シミュレーターを目指しています。
主な設計
第一の特徴は、行動表現の統一です。Pelican-Simは、主流の異なるロボット形態に対応する制御信号を28次元の行動値空間へ写像します。これにより、ロボットごとに別のモデルを用意するのではなく、共通モデルで異なるデバイスを扱える構成になります。一方で、機構や制御方式が違えば動力学も変わるため、モデルにはその差を捉える能力が求められます。
第二は、行動と視覚の注入方法です。単に行動ベクトルを視覚特徴へ連結するのではなく、URDFとカメラレンダリングを利用して、行動を反映した動画を生成します。この動画を介して、制御指令が画素レベルの変化にどうつながるかをモデルへ伝えます。素材によれば、代替的な融合ベースラインと比較してPSNRが0.904向上しました。
第三に、疎な混合専門家(MoE)を採用しています。ロボットの本体、場面、タスクごとに異なる動力学が現れるため、選択された専門家だけを計算に使う構造は、異種の挙動を扱う容量を増やせます。また、行動モダリティを取り込み、視覚情報と制御情報の衝突を抑えます。密なバックボーンと比較して、FVDは6.530低下しました。
第四は生成効率です。因果適応と少ステップ蒸留により、35ステップだった生成を4ステップの自己回帰シミュレーターに変換し、5.67倍の高速化を実現しました。計画、方策探索、合成データ生成では大量の試行が必要になるため、ロールアウト速度は実用性に直結します。
結果と意義
モデルは約100万本の実世界およびシミュレーション軌跡で学習されています。評価された最強ベースラインに対し、PSNRはAgiBotWorld Betaで4.636、RoboMINDで2.080、RoboTwinで10.343向上しました。RoboTwinでは、適応後のEWMBench DYNスコアも0.426上昇しています。
効果は映像予測だけにとどまりません。RoboTwinでは、各タスクに500本の生成軌跡と50本のデモンストレーションを加えると、方策成功率が70%から93%になりました。5つのチェックポイントにわたる方策評価ではPearson相関係数が0.994に達し、行動選択と方策改善の相対的な成功率向上はそれぞれ47.7%と20.3%でした。
Pelican-Simの重要性は、ワールドモデルを単なる動画予測器ではなく、行動の結果を予測する制御指向のシミュレーターとして位置付けた点にあります。ただし、長期計画、未知のロボット形態、実環境での閉ループ制御について、素材だけでは安定性を判断できません。今後は、予測性能が実機での信頼できる制御へ継続的につながるかを検証する必要があります。
コメント
ログイン状態を確認中…
コメントを読み込み中…