記事一覧へ戻る
ロボティクス・フィジカルAI

脳波はフィジカルAIの次の訓練データになるのか

読了目安 3 分

導入

生成AIはインターネット上のテキストを大量に利用して成長してきた。しかし、ロボットがコーヒーを注ぐ、ケーブルを差し込む、積み木を崩さず抜くといった動作を学ぶには、動画を眺めるだけでは足りない。TechCrunch によると、データツール企業 Encord はカリフォルニア州サンレアンドロの倉庫で、人間の作業者が実際に操作する様子を多角的に記録し、さらに脳波まで取り込む実験を進めている。

重要なポイント

  • ボトルネックはデータにある。 Encord は、ロボティクス企業が必要としているのは既存データの整理だけではなく、そもそも存在しない訓練データの生成だと見ている。言語モデルがウェブ上のテキストを利用できたのに対し、物理操作のデータは現場を作り、人を配置し、計測し、注釈を付けなければならない。

  • 脳波はまだ検証段階。 Encord はドイツの神経科学スタートアップ Zander Labs と協力し、脳活動から意図、エラー、驚きといった状態を推定できるかを試している。まず脳波タグ付きデータセットを作り、顧客のロボットモデルで性能向上があるかを確認してから拡大を判断する計画だ。

  • 主観視点映像だけでは不十分。 作業者が装着したカメラによる映像に加え、遠隔操作されたロボットアームや、片方の動きをもう片方が追従する装置も使われている。報道では、コーヒーを注ぐ、ポーカーチップを積む、サーバー背面のイーサネットケーブルを抜き差しする、といった課題が紹介されている。

  • 詳細な注釈は価値が高いが高コスト。 Encord は「右手でボルトを締める」といった物理的な説明を映像に付与し、LLMベースのロボットシステムが行動を理解しやすくしている。特定タスク向けには粗い主観映像より価値が高いとされる一方、生成コストも大きい。

意義と影響

この記事が示すのは、フィジカルAIが生成AIと同じ経済構造では動かないということだ。テキストは低コストで収集できても、ロボットの訓練データは、カメラ、センサー、ロボット装置、人間の作業者、注釈プロセスを組み合わせて作る必要がある。

脳波が本当にロボット学習の鍵になるかはまだ分からない。もし人間が迷った瞬間、ミスに気づいた瞬間、強い注意を払った瞬間をデータとして示せるなら、訓練サンプルの質を高める可能性がある。一方で効果が限定的なら、業界は映像、遠隔操作、筋電など、より扱いやすい手法を中心に進むだろう。いずれにしても、ロボットAIの競争はモデル開発だけでなく、現実世界の経験をどう生産するかに広がっている。

出典:TechCrunch AI

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
DriveZero:人間の実演を超えて学習する自動運転
ロボティクス・フィジカルAI
cctest.ai

DriveZero:人間の実演を超えて学習する自動運転

DriveZeroは、閉ループ強化学習と視覚基盤モデルを組み合わせ、人間の運転ログだけに依存しないエンドツーエンド自動運転を目指す。知覚と行動を別々に学習し、最後に蒸留によってカメラのみのプランナーへ統合する。

続きを読む
CCTest · Blog
RoboTok、インターネット動画から器用なロボット操作の示範を検索
ロボティクス・フィジカルAI
cctest.ai

RoboTok、インターネット動画から器用なロボット操作の示範を検索

RoboTokは、人間による操作動画を検索クエリとして、似た手の動きを含むウェブ動画を探し出すデータエンジンです。行為者中心の3D手軌跡を使うことで、カメラ視点や遮蔽、背景が異なる動画同士の比較を目指します。

続きを読む
CCTest · Blog
Qwen-Drive-1.0:視覚言語モデルを自動運転へ拡張する試み
ロボティクス・フィジカルAI
cctest.ai

Qwen-Drive-1.0:視覚言語モデルを自動運転へ拡張する試み

Qwen-Drive-1.0は、事前学習済みの視覚言語モデルを土台に、3D認識、視覚質問応答、運動計画を一つの枠組みに統合する初期的な試みです。BEV認識ヘッドと計画エキスパートによって、共有表現を検査可能なシーン構造と将来軌道へ接続します。

続きを読む