DriveZero:人間の実演を超えて学習する自動運転
導入
多くのエンドツーエンド自動運転システムは、人間の運転ログを模倣することで学習する。この方法は実用的だが、記録された軌跡の範囲に強く制約される。人間が経験しなかった状況や、ログに存在しない別の進み方、十分に記録されていない運転意図は、模倣だけでは学びにくい。小米の自動運転チームが提案したDriveZeroは、行動の教師信号をインタラクションから生成することで、この制約を乗り越えようとする。
「見る」と「動く」を分ける
DriveZeroは自動運転を知覚モデルと行動モデルに分解する。知覚には大量で多様な画像データが適している一方、行動には決定の結果が次の状態に影響する閉ループのフィードバックが必要だという考え方である。
- 行動モデルのDriveRL。 DriveRLは、nuPlanの実運転ログをインタラクティブな混合エージェント環境に変換する。背景車両ごとに、ログ再生、ルールベース制御、学習済み方策など異なる行動プロバイダーを割り当てられる。これにより、固定軌跡の再生だけに頼らない環境を構築する。特権情報を利用する570万パラメータの教師方策をPPOで訓練し、閉ループのロールアウトを通じて行動を改善する。
- 知覚モデルのDriveVFM。 DriveVFMはDINOv3、SigLIP2、SAM、Depth Anything V2の凍結済み視覚モデルを一つのバックボーンに統合する。タスク固有のラベルを使わず、生画像から物体、意味、幾何、深度などに関する汎用的な表現を学習する。
- 蒸留によるDriveZero。 最終的なカメラのみのプランナーは、DriveVFMでマルチビュー画像を符号化し、軌道候補を出力する。人間の運転操作を直接模倣するのではなく、DriveRL教師が閉ループ環境で生成した軌跡から学習する。さらに目標条件付き教師へ拡張された運転意図を入力することで、元のログにはない目標整合的なデータを生成できる。
結果と注意点
nuPlanでは、価値誘導型のテスト時アクション探索を組み合わせたDriveRLが、Val14、Test14-hard、Test14-randomの各分割における非反応式・反応式設定で平均93.57点を報告し、ログ再生エキスパートを上回った。DriveRLのロールアウトだけで学習したDriveZeroも、NAVSIMv1、NAVSIMv2、閉ループHUGSIMで最先端の結果を達成したとされる。
一方、特権教師とカメラのみの実装には情報差があり、混合エージェント環境が現実の交通をどこまで再現できるかも重要である。ベンチマークでの向上は、実道路における長尾の安全問題が解決したことを意味しない。
意義
DriveZeroは、視覚事前学習で世界理解を高め、閉ループ強化学習で相互作用能力を高め、蒸留で両者を実装可能なプランナーへまとめる訓練設計を示している。この方法が多様な実道路条件へ安定して移行できれば、人間の実演データへの依存を抑え、新しい運転目標や稀な行動のためのデータ生成を容易にする可能性がある。
コメント
ログイン状態を確認中…
コメントを読み込み中…