記事一覧へ戻る
世界モデル

DreamTrue、ロボット世界モデルの動作追従性を高める

読了目安 3 分

概要

ロボット向けの世界モデルに求められるのは、見栄えのよい動画を作ることだけではありません。ロボットが特定の動作を実行したとき、その動作に応じて物体や環境が変化する未来を予測できることが重要です。DreamTrue は、この「動作に忠実な予測」を中心に設計された、多視点・異種ロボット対応の世界モデルです。

既存のロボットデータには二つの課題があります。一つ目は、動作情報と映像の位置合わせです。キャリブレーションが不正確だと、記録された軌跡とカメラ画像内のロボットの動きがずれ、モデルが入力動作とは異なる未来を生成する可能性があります。二つ目は、失敗した相互作用の不足です。データセットには成功した操作が多く含まれやすいため、モデルが本来なら失敗する接触でも、成功する未来を予測する偏りを持つことがあります。

DreamTrue の仕組み

DreamTrue はまず、ロボットの動作軌跡を画像空間の条件へ変換します。そのうえでオフラインの幾何補正を行い、条件と対象動画の間にある位置的なずれを調整します。これにより、ロボットがどこを移動し、物体とどのように接触するはずかを、視覚的な形式でモデルに伝えやすくします。異なるロボット形態をまたいで利用できる構成を目指している点も特徴です。

次に、反実仮想ポストトレーニングを導入します。既存の記録から動作軌跡を変更し、異なる動作や接触条件に対応する未来動画を生成します。これは、実際に収録された成功データをそのまま再現するだけでなく、別の経路、接触、操作結果をモデルに経験させる方法です。生成データによって、相互作用の分布をより広げることが狙いです。

ただし、反実仮想動画には現実世界で撮影された正解の未来が対応しているとは限りません。そこで研究チームは、ロボットの欠陥、物体の欠陥、相互作用の欠陥を含む動画データセットを人手で注釈し、具身動画報酬モデルを学習しました。このモデルのスコアを強化学習の後段に利用し、接触や運動が不自然な予測を減らします。

結果と意味

AgiBot での評価では、論文が報告する動作追従性能で最高水準を達成し、人手で評価した相互作用の欠陥率を 48.12% から 6.25% に低減しました。また、AgiBot World Challenge 2026 の世界モデル部門で首位になったとされています。提供された素材には実験条件や比較対象の詳細がないため、数値の解釈には論文本文の確認が必要です。

DreamTrue の重要性は、世界モデルの評価軸を映像の自然さだけから、動作の結果が妥当かどうかへ広げた点にあります。幾何補正は条件付けの精度を高め、反実仮想データは失敗や多様な接触を補い、報酬モデルは正解動画がない場合の評価信号を提供します。一方で、生成された反実仮想が現実の失敗をどこまで再現できるか、異なるロボットや環境へ安定して転移できるかは、今後の検証課題です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
WorldSonus、世界モデルにリアルタイムの空間音響を加える
世界モデル
cctest.ai
世界モデル

WorldSonus、世界モデルにリアルタイムの空間音響を加える

WorldSonusは、動画からリアルタイムに制御可能なステレオ音声を生成する、世界モデル向けのインタラクティブなフレームワークです。論文ではRTF 0.41を報告し、オープンドメインの動画音声生成ベンチマークでも高い性能を示しています。

続きを読む