TacForcing:让机器人在执行动作时真正“感受”触觉
TacForcing提出一种流式动作生成框架,将执行过程中的实时触觉反馈直接纳入视觉语言动作模型,而不再依赖独立的高频反应控制器。实验显示,该方法在仿真和真实接触丰富操作任务中均优于强基线。
阅读全文TacForcing提出一种流式动作生成框架,将执行过程中的实时触觉反馈直接纳入视觉语言动作模型,而不再依赖独立的高频反应控制器。实验显示,该方法在仿真和真实接触丰富操作任务中均优于强基线。
阅读全文Zero-WAM 将人类操作视频作为机器人策略的上下文提示,使机器人无需更新参数即可尝试训练阶段未出现的操作任务。研究团队还构建了包含 7.42 万组人机配对样本的 HumanGen 数据集,并在仿真测试中验证了方法的跨任务泛化能力。
阅读全文Anthropic推出处于研究预览阶段的模型硬件标准(MHS),试图像MCP连接软件一样,让Claude发现并调用机械臂、显微镜和实验仪器。它探索的不是为模型打造固定身体,而是让AI临时借用不同设备完成任务。
阅读全文StreamPI在不增加模型参数的前提下,为以单帧输入为主的视觉语言动作模型引入流式时序建模。通过指令锚定注意力与随机间隔训练,它试图让机器人更好地利用历史观察,并适应真实部署中的异步视觉输入。
阅读全文GigaBrain-0.7试图把理解、预测与行动统一到一个具身基础模型中,并通过三系统架构引入面向行动前模拟和评估的世界模型。论文称,该模型在超过3.7万小时异构具身数据上预训练,面向多种机器人展现出更强的任务适应性。
阅读全文WorldToken 将每个决策时刻的多视角图像、本体感知和任务条件融合为一个世界令牌,再用因果 Transformer 建模时间序列。实验显示,目标域数据和较长历史上下文对模仿学习表现尤其重要。
阅读全文PhysCaP 为代码即策略机器人引入物理信息驱动的主动感知机制,使机器人不再只依赖视觉观察,而是通过有针对性的交互判断物体的质量与刚度。该方法在减少无效探索的同时,提升了复杂桌面操作任务中的决策能力。
阅读全文由游戏数据驱动的AI初创公司General Intuition正洽谈新一轮融资,投前估值或达60亿美元。公司计划将资金投入通用模型、算力和机器人应用。
阅读全文DeepMind提出EXIMO,用视觉语言模型规划长时任务,再结合模仿学习与残差离策略强化学习,高效微调视觉-语言-动作策略。该方法试图减少昂贵的遥操作数据需求,并提升机器人学习新任务的样本效率。
阅读全文九识智能与宇通联合推出无人轻卡Z20,额定载重4.2吨、货厢容积19.32立方米,面向工厂、园区和大型仓储中心的高频接驳。它释放出的信号是:L4自动驾驶正在从末端配送走向更高运力的产业物流。
阅读全文Generalist发布机器人基础模型GEN-1.5,尝试将大模型的上下文学习能力带入物理世界。模型在不更新参数的情况下,仅凭3至12秒动作示范即可执行部分新任务。
阅读全文Zetta 提出一种闭环具身智能框架:在冻结基础策略的前提下,在线进化运行时批评器与恢复技能。它将动作级干预、回合级复盘和验证式更新结合起来,提升机器人在复杂环境中的执行可靠性。
阅读全文这项工作提出了一条把第一人称人类操作视频转换为机器人训练数据的流水线,目标不是做单个任务的演示复刻,而是为具备泛化能力的视觉-语言-动作模型提供大规模预训练数据。研究同时给出了更系统的泛化评测框架。
阅读全文这篇论文指出,自动驾驶 VLM 在用链式思维监督训练时,如果提前看到真实未来轨迹,可能学到的是事后合理化,而不是真正基于场景证据推理。作者提出 AD-MCQ 与 DEFT-RLVR,把轨迹从决策前提示改为决策后验证目标。
阅读全文SGTP 面向多车自动驾驶竞速中的高强度交互,把博弈论推理与 GPU 加速的采样式轨迹规划结合起来,在实时性、安全约束和策略多样性之间寻求平衡。
阅读全文ITMO University 等作者提出 Collective-State JEPA,用去中心化方式让群体中的每台机器人形成对共同未来状态的预测。论文重点展示了该方法在少量全局标签、拓扑变化和规模变化下的泛化能力。
阅读全文RL²-VLA 提出一种面向视觉-语言-动作模型的自适应测试时引导框架:不改动原有 VLA,只在模型可能失败时引入离线强化学习策略来扩展动作选择。
阅读全文N_0-VTLA 试图补上当前视觉-语言-动作模型在“接触丰富”操作中的短板:让机器人不仅看见物体,也能利用触觉反馈做细微调整。论文还提出 ALTER,用已有部署数据继续离线改进策略。
阅读全文WAIC 2026 的热闹不只来自大模型和机器人展台,更来自一个更现实的问题:AI究竟在哪些场景已经进入生产,哪些仍停留在Demo和叙事中。
阅读全文