TacForcing、実行中の触覚フィードバックでロボット動作を更新
TacForcingは、ロボットが動作を実行している最中に得た触覚情報を、視覚言語行動モデルへ取り込むストリーミング動作生成フレームワークです。独立した高周波リアクティブ制御器を追加せず、未実行の動作を逐次的に修正します。
続きを読むTacForcingは、ロボットが動作を実行している最中に得た触覚情報を、視覚言語行動モデルへ取り込むストリーミング動作生成フレームワークです。独立した高周波リアクティブ制御器を追加せず、未実行の動作を逐次的に修正します。
続きを読むZero-WAMは、人間の操作動画をロボットに対するタスク指定として利用し、モデルのパラメータを更新せずに未学習の操作へ対応する手法です。HumanGenデータセットとIFP学習目標を組み合わせ、シミュレーションでタスク横断の汎化を検証しました。
続きを読むAnthropicは、AIエージェントがロボットアームや顕微鏡、実験機器を発見・操作するための「Model Hardware Standard(MHS)」研究プレビューを公開した。Claudeに固定された身体を与えるのではなく、接続された機器を必要に応じて使う発想だ。
続きを読むStreamPIは、追加パラメータなしで単一フレーム型の視覚・言語・行動モデルに時系列推論を導入する。指示を軸にした注意機構とランダム間隔学習により、ロボットが過去の観測を活用し、非同期入力にも対応できるようにする。
続きを読むGigaBrain-0.7は、視覚言語理解、世界予測、ロボット行動を結び付ける三システム構成を提案する具現知能モデルです。3万7,000時間超の異種データで事前学習し、異なるロボット本体やタスクへの汎化を目指します。
続きを読むWorldTokenは、各時刻のマルチビュー画像、固有感覚、タスク条件を1つのワールドトークンに統合し、時間方向の系列として処理する手法です。実験では、対象領域のデータ量と長い履歴コンテキストの重要性が示されました。
続きを読むPhysCaPは、コード・アズ・ポリシー型のロボットに物理情報に基づく能動探索を加える手法です。ロボットは視覚だけに頼らず、身体感覚から物体の重さや硬さを推定し、必要な場合だけ追加の操作を行います。
続きを読むGeneral Intuitionが、プレマネー評価額60億ドルでの新たな資金調達を協議している。ゲームの操作データを基盤に、時空間を移動するAIエージェントとロボット向けモデルの開発を進める。
続きを読むτ₀-VLA は、長期ロボット操作の高レベル計画に世界モデル誘導のテスト時計算を導入し、不確実な場面で複数のサブタスク候補を比較します。
続きを読むDeepMindは、VLMによる探索、模倣学習、残差オフポリシー強化学習を組み合わせたVLA方策の微調整手法EXIMOを提案した。新しいタスクへの適応に必要なデータ量の削減を目指す。
続きを読む九識智能と宇通が、最大積載量4.2トン、荷室容量19.32立方メートルの自動運転軽トラック「Z20」を発表した。工場や工業団地、大型物流拠点内の高頻度輸送を主な対象とする。
続きを読むGeneralistのGEN-1.5は、大規模な物理インタラクションデータで事前学習したロボット基盤モデルです。3〜12秒の実演を見せるだけで、パラメータ更新なしに未経験タスクへ挑戦します。
続きを読むZetta は、基盤ポリシーを凍結したまま、実行時クリティックと復旧スキルをオンラインで進化させる具現知能向けハーネスです。行動時の介入、ロールアウト分析、検証を通過した更新を三つの時間スケールで組み合わせます。
続きを読むEgo2Robot は、一人称視点の人間による操作動画をロボット向け学習データへ変換するパイプラインだ。単なる模倣ではなく、基盤モデルの事前学習に使える規模と多様性を目指している。
続きを読むこの論文は、自動運転 VLM の CoT 教師データ作成で正解の未来軌道を先に見せると、モデルが因果的に推論するのではなく事後的に理由づけしてしまうと指摘する。AD-MCQ と DEFT-RLVR は、計画を候補軌道の選択問題として再定式化する。
続きを読むN₀-TWAM は、接触を多く含むロボット操作に向けた触覚ネイティブな world-action model で、将来の映像だけでなく将来の接触も予測する点が特徴です。
続きを読むSGTP は、多車両の自動運転レースにおける激しい相互作用を扱うため、ゲーム理論的推論と GPU 加速サンプリングを組み合わせたリアルタイム計画フレームワークです。
続きを読むITMO University らの論文は、群ロボット向けの分散型予測アーキテクチャ Collective-State JEPA を提案した。各ロボットは局所履歴と限られた通信だけで、同じ将来の集団状態を表す表現を出力する。
続きを読むN_0-VTLA は、視覚と言語だけでは難しい接触の多いロボット操作に焦点を当てた VTLA 基盤モデルです。大規模な視覚・触覚事前学習と、ALTER によるオフライン方策改善を組み合わせています。
続きを読むWAIC 2026ではロボットや大規模モデルが注目を集めたが、より重要なのは、それらが実際の業務や産業プロセスに入り込んでいるかどうかだ。
続きを読む