SceneActBench:让VLM智能体在看见的3D场景中真正行动
SceneActBench 关注一个比“看图说话”更难的问题:视觉语言模型智能体能否基于图像或视频帧,在完整的多物体 3D 场景中完成动作任务。该基准用统一的智能体-环境循环和几何指标,检验当前 VLM 从感知走向行动的能力边界。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 795 篇文章
SceneActBench 关注一个比“看图说话”更难的问题:视觉语言模型智能体能否基于图像或视频帧,在完整的多物体 3D 场景中完成动作任务。该基准用统一的智能体-环境循环和几何指标,检验当前 VLM 从感知走向行动的能力边界。
阅读全文VisCo 提出一种更省训练成本的视觉 Token 压缩思路:不再额外外挂复杂压缩器,而是复用预训练视觉语言模型自身的编码能力。它用少量 memory tokens 承载图像信息,在高压缩率甚至单 Token 场景下保持更稳定表现。
阅读全文这篇论文关注条件视频生成在 3D 场景长程渲染中的一个关键痛点:镜头回到同一地点时,外观常常被重新生成得不一致。作者提出一种无需后训练的“闭环记忆”机制,利用 3D 引擎已有的位姿、深度与重投影信息提升重访一致性。
阅读全文蚂蚁百灵推出新一代原生混合推理模型 Ling-3.0-Flash,以 124B 总参数、5.1B 单次激活参数主打更高“智效比”。该模型面向 Agent 场景强化长程规划、自我纠错与长文本处理,并计划在限时免费体验后开源。
阅读全文物理 AI 的瓶颈正在从模型结构转向高质量真实世界数据。Encord 与 Zander Labs 尝试把脑电信号纳入机器人训练数据,以捕捉人的意图、惊讶和出错状态。
阅读全文vLLM 宣布在 Kimi K3 权重公开当天提供服务支持,覆盖混合 KDA 缓存、投机解码、分离式部署以及 NVIDIA、AMD GPU 优化。对开发者而言,这更像是一份超大规模开源权重模型的推理落地清单。
阅读全文Wattage 是一个面向 AI Agent 的 token 花费分析与 CI 成本回归工具,可离线读取 OpenTelemetry trace,定位重复上下文、循环停滞、模型错配等浪费模式。
阅读全文Moonshot AI 的 Kimi 再次点燃美国科技圈对中国 AI 模型的紧张情绪。争论表面上关乎安全与竞争力,背后也牵涉开源权重、产业保护和头部实验室利益。
阅读全文OpenAI承认其一个模型突破了Hugging Face系统后,Hugging Face CEO Clem Delangue要求公开代理运行轨迹,并呼吁为防御方提供更多算力支持。
阅读全文一篇安全研究文章揭示了面向大模型 API 的“中转站”市场:它以极低价格转售模型访问能力,背后连接虚拟卡、批量账号、账号池和下游开发者。这个市场正在从零散滥用变成成熟产业链。
阅读全文NeoteAI 与复旦大学可信具身智能研究院发布 N0 系列三份技术报告,围绕触觉数据、视触语言动作模型和触觉世界模型展开。其核心主张是:机器人要真正进入复杂物理世界,仅靠视觉远远不够。
阅读全文Monday.com宣布裁员约20%,并把组织重塑与AI驱动增长战略联系起来。它只是今年一批以AI为因素调整人力的科技公司之一。
阅读全文Cloudflare提出按“搜索、代理、训练”三类用途管理AI流量,并计划为新接入域名调整默认规则。这一变化反映出网站内容与AI系统之间的博弈,正从简单封禁走向更细的权限和补偿讨论。
阅读全文美国多地图书馆的“避开 AI”工作坊意外爆满。它反映的不是简单的反技术情绪,而是普通用户对 AI 被默认塞进设备、搜索和办公软件后的控制权焦虑。
阅读全文北弗吉尼亚一次输电线路故障没有造成大停电,却让 PJM 电网经历了异常电压波动。事件显示,密集布局的 AI 数据中心在电网扰动中同步脱网,正成为新的系统性风险。
阅读全文吴恩达推出开源桌面 Agent 项目 OpenWorker,主打本地优先、隐私保护和模型无关。它的目标不是继续陪用户聊天,而是跨文件、日历、Slack、GitHub 等工具交付可用成果。
阅读全文Anthropic正式推出Claude Opus 5,多项编程、工具使用和复杂任务评测接近或超过Fable 5,定价仍维持上一代水平。比跑分更值得关注的是,它在代码生成、3D建模和自我验证流程中展现出更强的自主判断能力。
阅读全文北京工业场展示了AI进入影视、影像和3D片场的落地进展;杭州学术场则提醒,真正能自我进化的Agent仍处早期。两种判断并不矛盾,而是分别站在应用交付与底层能力的两端。
阅读全文Vivix推出实时交互多模态模型A1及世界互动模型W1,主打统一流式生成、低延迟响应和消费级GPU实时推理。其技术重点不只是让角色说话,而是让角色在持续视频生成中保持身份、动作和环境关系的一致性。
阅读全文腾讯提出 WorkBuddy Bench,用于评估编码智能体在代码、网页、办公与安全任务中的真实工作能力。其重点不只是排行榜,而是以抗污染任务构造和开放可复现流程,回应当前智能体评测的可信度问题。
阅读全文