EXIMO:让VLM为VLA机器人策略规划探索路径
DeepMind提出EXIMO,用视觉语言模型规划长时任务,再结合模仿学习与残差离策略强化学习,高效微调视觉-语言-动作策略。该方法试图减少昂贵的遥操作数据需求,并提升机器人学习新任务的样本效率。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 775 篇文章
DeepMind提出EXIMO,用视觉语言模型规划长时任务,再结合模仿学习与残差离策略强化学习,高效微调视觉-语言-动作策略。该方法试图减少昂贵的遥操作数据需求,并提升机器人学习新任务的样本效率。
阅读全文一篇新研究提出 IAR 框架,试图让语言模型在推理时不接收检索片段,也能回答固定文档集合中的问题。它将文档注入、问答对齐和通用能力恢复分开处理,以缓解领域能力与通用能力之间的冲突。
阅读全文NARU 是一个面向日语极长视频理解的新基准,联合考察叙事演进追踪与文化语境推理。研究显示,现有多模态模型在跨长时段整合情节和理解隐含社会意义方面仍存在明显不足。
阅读全文一项新研究提出 Chain-of-Experience(CoE),通过在测试时累积交互痕迹与反馈,让大模型不再局限于一次性零样本回答。实验显示,自反馈、正确性信号和代码测试结果等机制可以共同推动模型迭代改进。
阅读全文QuoteBench指出,编码智能体的成功率不仅取决于模型生成了什么,还取决于命令经过怎样的序列化、包装和解析。若只看最终匹配分数,接口引入的失败可能会被误判为模型能力不足。
阅读全文LinkedIn表示,平台上线“看起来像AI垃圾内容”按钮后,已有超过100万人通过帖子菜单使用。与此同时,平台称被其识别为AI垃圾内容的帖子,获得的浏览量较此前减少了40%。
阅读全文Nvidia研究显示,同一个模型在不同Harness下,长程任务表现可能大幅分化。记忆管理、工具调用和监督智能体,正在成为智能体系统的关键竞争力。
阅读全文DeepSeek 在 API 平台上线 deepseek-v4-flash-vision-exp,首次为 V4 系列明确提供官方视觉输入能力。除了图像理解,新模型在工具调用、代码 Agent 和长周期任务测试中也出现明显提升。
阅读全文Meta AI Research 发布开放权重模型 Muse Glimmer,主打本地运行、视觉理解和多步工具调用。借助 4 位量化与 DFlash 推测解码,它试图把 30B 级智能体能力带到消费级硬件。
阅读全文视频生成的竞争正从单条画面质量,转向对 brief、素材、流程和交付的整体处理能力。MiniMax Design 的出现,体现了模型公司向创作软件层上移的趋势。
阅读全文九识智能与宇通联合推出无人轻卡Z20,额定载重4.2吨、货厢容积19.32立方米,面向工厂、园区和大型仓储中心的高频接驳。它释放出的信号是:L4自动驾驶正在从末端配送走向更高运力的产业物流。
阅读全文开源项目 OpenConnector 面向 AI Agent 和应用开发者,试图把分散的 SaaS 账号、认证流程与接口能力纳入统一运行时。它的重点不只是连接更多服务,也包括权限控制、标准化 Actions 和运行审计。
阅读全文Meta AI眼镜快速普及,让公共场所的非自愿录音风险受到更多关注。业余开发者推出检测应用,但蓝牙扫描只能发现设备在线,无法确认是否正在拍摄。
阅读全文Anthropic对14.1万次历史评估运行进行回溯审计,发现三起模型从隔离测试环境触达公共互联网的事件。问题并非单一模型失控,而是出口控制、环境识别和监控机制同时失效。
阅读全文DeepSeek 为 V4-Flash 推出实验性视觉版本 DeepSeek-V4-Flash-Vision-Exp,并通过 API 开放调用。官方信息显示,该版本在保留纯文本能力的同时,重点提升了视觉处理能力。
阅读全文Generalist发布机器人基础模型GEN-1.5,尝试将大模型的上下文学习能力带入物理世界。模型在不更新参数的情况下,仅凭3至12秒动作示范即可执行部分新任务。
阅读全文4DAnyone试图把未经标定的单目人物视频转化为多视角、跨时间一致的视频,再进一步重建4D人物。其关键在于用参考上下文压缩和目标视角路由,缓解视频扩散模型在多视角生成中的一致性瓶颈。
阅读全文DeepSeek Harness 公测一周后发布 v0.1.0-rc.8,新增原生图片请求与图文混合输入,并继续强化子 Agent、Windows 终端和极简模式。更值得关注的是,图片能力开始从单次对话走向命令与任务编排。
阅读全文AI实验室和企业对高质量训练数据的持续需求,正在推动数据标注与专家服务创业公司快速扩张。四年成立的Micro1在八个月内将年化总营收运行率从1亿美元提升至5亿美元。
阅读全文论文提出 Agentic Principal Chain(APC),将多智能体系统中的授权、委托范围、预算与历史行为纳入统一的外部决策层。实验显示,这种架构能显著降低数据外泄、破坏和操纵等风险。
阅读全文