記事一覧へ戻る
ロボティクス・フィジカルAI

ACE-Data-0:実家庭を具身AI向けデータエンジンに変える試み

読了目安 3 分

導入

具身AIの課題は、モデルの能力だけではなく、学習に使えるデータの質にもある。家庭内で行動するAIやロボットは、人が何を見て、どのように身体を動かし、手で物体を扱い、接触や音、物体状態の変化をどう伴わせるのかを時間の流れの中で理解しなければならない。ACE-Data-0 は、この一連の経験を断片化せず、同期した形で記録しようとするデータセットである。

核心ポイント

  • 人間中心の収録エンジン:論文は Ambient Capture Engine(ACE)を提案する。これは実際の家庭環境を、空間較正と時間同期が行われた記録スタジオのように扱う仕組みだ。
  • 2つのスケール:テーブルスケールでは手と物体の細かな操作を捉え、ルームスケールでは家具のある空間での全身動作、移動、生活動作を記録する。
  • 多モーダルな同期データ:一人称映像と多視点の外部映像に加え、全身動作、関節化された手の動き、物体形状と 6-DoF 軌跡、音声、触覚信号を統合している。
  • データ規模:ACE-Data-0 は 150 時間、1700 万動画フレーム、200 タスクカテゴリを含み、50 名の参加者が 2 つの環境で実施した合計 7万5000件のインタラクションから成る。
  • 自然な行動差の保持:手順を細かく指定するのではなく、目標レベルの指示を与えることで、参加者ごとの自然な解き方や動きの違いを残している。

意義と影響

従来の具身AIデータセットは、視点、モダリティ、空間スケールのいずれかで分断されがちだった。手元の操作は見えても全身の文脈がない、外部カメラ映像はあっても一人称視点がない、動作はあっても接触や物体状態が十分に揃っていない、といった問題があった。ACE-Data-0 の特徴は、これらの情報を同じ時間軸上で結び付けている点にある。

論文では、信号レベルからシーン構成要素、さらにインタラクションへ進む階層的ベンチマークも示されている。著者らによれば、既存の最先端手法は接触、遮蔽、自己運動、長い時間範囲のタスクでなお大きな課題を抱えている。つまり、このデータセットは単なる訓練素材ではなく、具身モデルの弱点を測る評価基盤にもなる。

模倣学習、世界モデル、視覚・言語・行動システム、家庭ロボットにとって、ACE-Data-0 は人間の実演をより立体的に扱うための出発点となる。ただし、現時点では 2 環境・50 名のデータであり、今後はより多様な家庭、物体、長期タスクへ拡張できるかが重要になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
汎用エージェントがロボットを直接操作する「Agent as Policy」
ロボティクス・フィジカルAI
cctest.ai

汎用エージェントがロボットを直接操作する「Agent as Policy」

Agent as Policyは、汎用的なコーディングエージェントを実物のロボットに接続し、視覚観察から実行可能なプログラムを作成して動作を指示する仕組みです。現実の結果を再び読み取り、次の行動を修正することで、専用訓練なしの操作を目指します。

続きを読む
CCTest · Blog
PhysBrain 1.5、認識・行動生成・未来予測を一つのモデルに統合
ロボティクス・フィジカルAI
cctest.ai

PhysBrain 1.5、認識・行動生成・未来予測を一つのモデルに統合

PhysBrain 1.5は、視覚言語モデルを物理環境の理解、エンドエフェクタの動作生成、未来状態の予測まで扱う具身基盤モデルへ拡張する試みです。論文によれば、8Bモデルは28件の具身理解ベンチマークで平均72.5点を達成しました。

続きを読む
CCTest · Blog
MobileVLA-R1 2.0、強化学習でロボットの推論と行動を接続
ロボティクス・フィジカルAI
cctest.ai

MobileVLA-R1 2.0、強化学習でロボットの推論と行動を接続

MobileVLA-R1 2.0は、構造化された身体的推論、強化学習、推論条件付きアクションデコーダを組み合わせ、言語理解からロボット実行までの隔たりに取り組む。ナビゲーション、四脚ロボット、人型移動マニピュレーションで評価された。

続きを読む