記事一覧へ戻る
ロボティクス・フィジカルAI

RynnBrain 1.1、ロボット操作に近づく具身基盤モデル

読了目安 3 分

導入

RynnBrain 1.1 は、具身 AI を「画像や言語を理解するモデル」から「ロボットの行動に結びつくモデル」へ近づける試みです。単にマルチモーダルに対応するのではなく、時空間情報と物理的な制約を前提に学習し、知覚、空間推論、位置推定、計画を一体化しています。ロボット分野では、理解できることと実行できることの間に大きな溝がありますが、この研究はその溝を縮めることを狙っています。

主なポイント

  • 複数スケールを展開: 2B、9B、122B-A10B のモデル群を用意し、用途や計算資源に応じた選択肢を提供。
  • 操作に直結する表現: モデルファミリー全体で接触点予測を導入し、物体にどこで触れるかという操作上重要な情報を扱いやすくした。
  • 3D grounding を強化: 2B と 9B ではネイティブな 3D grounding を搭載し、空間的な位置関係をより直接的に出力できるようにした。
  • RynnBrain-VLA を開発: クロスエンボディメント向けの統一アクション空間と、ロボットごとの差異を吸収する masking を採用。Unitree G1、Astribot-S1、Tianji-Wuji に展開している。
  • 評価結果: 論文では、122B-A10B が VSI-Bench、MMSI、RefSpatial-Bench で評価対象の商用・オープンソースモデルを上回ったとしている。また実機実験では、RynnBrain 初期化の方策が Qwen ベースや代表的な汎用 VLA を上回った。

何が重要か

この研究の価値は、具身モデルにおいて「見える」だけでなく「触れる」「動かせる」ことまで見据えている点にあります。ロボットにとって重要なのは、物体の名前を当てることではなく、どこに位置し、どこを掴み、どの順序で動作すべきかを判断することです。RynnBrain 1.1 は、その判断に必要な幾何情報と物理情報を、モデル設計の段階から取り込もうとしています。

また、複数のロボット本体にまたがる学習設計は実用上の意味が大きいです。現実の現場では、同じモデルを別のロボットへ移したい場面が多く、個別最適化だけでは運用コストが高くなります。クロスエンボディメントの考え方は、その移植性を高める方向として注目できます。

もちろん、ベンチマークで強いことと、複雑な環境で常に安定して動くことは同義ではありません。それでも、RynnBrain 1.1 は具身基盤モデルが「理解中心」から「行動中心」へ移っていることを示す一例であり、今後のロボット操作研究の方向性をよく表しています。

出典: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
RoboTok、インターネット動画から器用なロボット操作の示範を検索
ロボティクス・フィジカルAI
cctest.ai

RoboTok、インターネット動画から器用なロボット操作の示範を検索

RoboTokは、人間による操作動画を検索クエリとして、似た手の動きを含むウェブ動画を探し出すデータエンジンです。行為者中心の3D手軌跡を使うことで、カメラ視点や遮蔽、背景が異なる動画同士の比較を目指します。

続きを読む
CCTest · Blog
Qwen-Drive-1.0:視覚言語モデルを自動運転へ拡張する試み
ロボティクス・フィジカルAI
cctest.ai

Qwen-Drive-1.0:視覚言語モデルを自動運転へ拡張する試み

Qwen-Drive-1.0は、事前学習済みの視覚言語モデルを土台に、3D認識、視覚質問応答、運動計画を一つの枠組みに統合する初期的な試みです。BEV認識ヘッドと計画エキスパートによって、共有表現を検査可能なシーン構造と将来軌道へ接続します。

続きを読む
CCTest · Blog
Nori Robotics、1,688ドルの両腕移動ロボットを開発者向けに投入
ロボティクス・フィジカルAI
cctest.ai

Nori Robotics、1,688ドルの両腕移動ロボットを開発者向けに投入

Nori Roboticsは、ロボット開発者と研究者を対象にした1,688ドルの両腕移動ロボットを発表した。高価な脚式機構やオンボード計算を避け、複数台を使った実験と修理のしやすさを重視する設計だ。

続きを読む