RoboTok、インターネット動画から器用なロボット操作の示範を検索
RoboTokは、人間による操作動画を検索クエリとして、似た手の動きを含むウェブ動画を探し出すデータエンジンです。行為者中心の3D手軌跡を使うことで、カメラ視点や遮蔽、背景が異なる動画同士の比較を目指します。
続きを読むRoboTokは、人間による操作動画を検索クエリとして、似た手の動きを含むウェブ動画を探し出すデータエンジンです。行為者中心の3D手軌跡を使うことで、カメラ視点や遮蔽、背景が異なる動画同士の比較を目指します。
続きを読むQwen-Drive-1.0は、事前学習済みの視覚言語モデルを土台に、3D認識、視覚質問応答、運動計画を一つの枠組みに統合する初期的な試みです。BEV認識ヘッドと計画エキスパートによって、共有表現を検査可能なシーン構造と将来軌道へ接続します。
続きを読むNori Roboticsは、ロボット開発者と研究者を対象にした1,688ドルの両腕移動ロボットを発表した。高価な脚式機構やオンボード計算を避け、複数台を使った実験と修理のしやすさを重視する設計だ。
続きを読むNavMCPは、視覚言語モデルのタスク推論とナビゲーション基盤モデルの閉ループ実行を組み合わせる。複数回の探索で証拠を蓄積し、長期的な物理世界のタスクに対応する仕組みだ。
続きを読むロボット軌跡は収集コストが高く、ウェブ規模のデータへ拡張しにくい。そのためVLAモデルでは、限られたデータから他のロボットにも移せる表現を学ぶことが重要になる。
続きを読む米国は外国製ドローンや先進ロボットへの規制を強めている。しかし、中国企業の生産規模、供給網、価格競争力は消えず、競争の舞台が米国以外へ移る可能性がある。
続きを読むMetaは、サーバーの再起動、電源操作、ネットワークケーブルの交換、設備点検などを担うロボットをデータセンターで試験している。人手不足の解消が期待される一方、技術職の再編も懸念される。
続きを読むZero-WAMは、人間の操作動画をロボットに対するタスク指定として利用し、モデルのパラメータを更新せずに未学習の操作へ対応する手法です。HumanGenデータセットとIFP学習目標を組み合わせ、シミュレーションでタスク横断の汎化を検証しました。
続きを読むTacForcingは、ロボットが動作を実行している最中に得た触覚情報を、視覚言語行動モデルへ取り込むストリーミング動作生成フレームワークです。独立した高周波リアクティブ制御器を追加せず、未実行の動作を逐次的に修正します。
続きを読むAnthropicは、AIエージェントがロボットアームや顕微鏡、実験機器を発見・操作するための「Model Hardware Standard(MHS)」研究プレビューを公開した。Claudeに固定された身体を与えるのではなく、接続された機器を必要に応じて使う発想だ。
続きを読むStreamPIは、追加パラメータなしで単一フレーム型の視覚・言語・行動モデルに時系列推論を導入する。指示を軸にした注意機構とランダム間隔学習により、ロボットが過去の観測を活用し、非同期入力にも対応できるようにする。
続きを読むGigaBrain-0.7は、視覚言語理解、世界予測、ロボット行動を結び付ける三システム構成を提案する具現知能モデルです。3万7,000時間超の異種データで事前学習し、異なるロボット本体やタスクへの汎化を目指します。
続きを読むWorldTokenは、各時刻のマルチビュー画像、固有感覚、タスク条件を1つのワールドトークンに統合し、時間方向の系列として処理する手法です。実験では、対象領域のデータ量と長い履歴コンテキストの重要性が示されました。
続きを読むPhysCaPは、コード・アズ・ポリシー型のロボットに物理情報に基づく能動探索を加える手法です。ロボットは視覚だけに頼らず、身体感覚から物体の重さや硬さを推定し、必要な場合だけ追加の操作を行います。
続きを読むGeneral Intuitionが、プレマネー評価額60億ドルでの新たな資金調達を協議している。ゲームの操作データを基盤に、時空間を移動するAIエージェントとロボット向けモデルの開発を進める。
続きを読むDeepMindは、VLMによる探索、模倣学習、残差オフポリシー強化学習を組み合わせたVLA方策の微調整手法EXIMOを提案した。新しいタスクへの適応に必要なデータ量の削減を目指す。
続きを読むτ₀-VLA は、長期ロボット操作の高レベル計画に世界モデル誘導のテスト時計算を導入し、不確実な場面で複数のサブタスク候補を比較します。
続きを読む九識智能と宇通が、最大積載量4.2トン、荷室容量19.32立方メートルの自動運転軽トラック「Z20」を発表した。工場や工業団地、大型物流拠点内の高頻度輸送を主な対象とする。
続きを読むGeneralistのGEN-1.5は、大規模な物理インタラクションデータで事前学習したロボット基盤モデルです。3〜12秒の実演を見せるだけで、パラメータ更新なしに未経験タスクへ挑戦します。
続きを読むZetta は、基盤ポリシーを凍結したまま、実行時クリティックと復旧スキルをオンラインで進化させる具現知能向けハーネスです。行動時の介入、ロールアウト分析、検証を通過した更新を三つの時間スケールで組み合わせます。
続きを読むEgo2Robot は、一人称視点の人間による操作動画をロボット向け学習データへ変換するパイプラインだ。単なる模倣ではなく、基盤モデルの事前学習に使える規模と多様性を目指している。
続きを読む