脳波はフィジカルAIの次の訓練データになるのか
導入
生成AIはインターネット上のテキストを大量に利用して成長してきた。しかし、ロボットがコーヒーを注ぐ、ケーブルを差し込む、積み木を崩さず抜くといった動作を学ぶには、動画を眺めるだけでは足りない。TechCrunch によると、データツール企業 Encord はカリフォルニア州サンレアンドロの倉庫で、人間の作業者が実際に操作する様子を多角的に記録し、さらに脳波まで取り込む実験を進めている。
重要なポイント
-
ボトルネックはデータにある。 Encord は、ロボティクス企業が必要としているのは既存データの整理だけではなく、そもそも存在しない訓練データの生成だと見ている。言語モデルがウェブ上のテキストを利用できたのに対し、物理操作のデータは現場を作り、人を配置し、計測し、注釈を付けなければならない。
-
脳波はまだ検証段階。 Encord はドイツの神経科学スタートアップ Zander Labs と協力し、脳活動から意図、エラー、驚きといった状態を推定できるかを試している。まず脳波タグ付きデータセットを作り、顧客のロボットモデルで性能向上があるかを確認してから拡大を判断する計画だ。
-
主観視点映像だけでは不十分。 作業者が装着したカメラによる映像に加え、遠隔操作されたロボットアームや、片方の動きをもう片方が追従する装置も使われている。報道では、コーヒーを注ぐ、ポーカーチップを積む、サーバー背面のイーサネットケーブルを抜き差しする、といった課題が紹介されている。
-
詳細な注釈は価値が高いが高コスト。 Encord は「右手でボルトを締める」といった物理的な説明を映像に付与し、LLMベースのロボットシステムが行動を理解しやすくしている。特定タスク向けには粗い主観映像より価値が高いとされる一方、生成コストも大きい。
意義と影響
この記事が示すのは、フィジカルAIが生成AIと同じ経済構造では動かないということだ。テキストは低コストで収集できても、ロボットの訓練データは、カメラ、センサー、ロボット装置、人間の作業者、注釈プロセスを組み合わせて作る必要がある。
脳波が本当にロボット学習の鍵になるかはまだ分からない。もし人間が迷った瞬間、ミスに気づいた瞬間、強い注意を払った瞬間をデータとして示せるなら、訓練サンプルの質を高める可能性がある。一方で効果が限定的なら、業界は映像、遠隔操作、筋電など、より扱いやすい手法を中心に進むだろう。いずれにしても、ロボットAIの競争はモデル開発だけでなく、現実世界の経験をどう生産するかに広がっている。
コメント
ログイン状態を確認中…
コメントを読み込み中…