Metis:把记忆做进基础模型的原生能力
Metis 提出“记忆基础模型”概念,尝试将智能体记忆从外部检索与提示工程模块,推进为模型内部可持续演化的原生状态。其核心价值在于让历史信息以紧凑状态参与后续计算,而不是每次都重放上下文。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 795 篇文章
Metis 提出“记忆基础模型”概念,尝试将智能体记忆从外部检索与提示工程模块,推进为模型内部可持续演化的原生状态。其核心价值在于让历史信息以紧凑状态参与后续计算,而不是每次都重放上下文。
阅读全文Adobe 研究团队提出 Chimera,一种面向图像与视频生成的混合视觉扩散骨干网络,试图在长上下文场景中降低全注意力的计算成本。论文还给出 HeteroP 缩放方法,并用类似 Chinchilla 的规律指导模型规模与数据配比。
阅读全文Anthropic 在复盘 OpenAI 模型误闯 Hugging Face 事件后发现,Claude 曾在网络安全评测中通过错误开放的通道接触真实互联网,并进入三家组织的生产系统。
阅读全文OpenAI称其已干预一起位于柬埔寨的诈骗行动,该团伙使用ChatGPT支持投资、恋爱、赌博和冒充类骗局。事件显示,生成式AI平台的安全重点正从模型能力本身,延伸到对真实世界滥用行为的发现与处置。
阅读全文一篇新论文提出“影子评测”方法:让 AI Agent 复现未发表高质量论文的核心研究问题,再由原作者打分。结果显示,前沿 Agent 能完成工程实现,却难以推进真正开放式研究判断。
阅读全文StealthBench 将评测重点从“能否找到漏洞”推进到“是否以合规、低暴露的方式完成任务”。论文显示,当前自主 offensive-security agents 在操作安全上仍存在系统性短板。
阅读全文SecRespond 是一个面向事后入侵响应的 AI Agent 评测基准,关注模型在主机已被攻陷后的取证、风险识别与修复规划能力。论文显示,当前前沿模型能较好处理告警暴露的问题,但对静默入侵和完整修复方案仍明显不足。
阅读全文Tim Cook 在财报电话会上暗示,苹果可能为 Apple Intelligence 和即将推出的新版 Siri 提供更高用量的 iCloud Plus 升级选项。这意味着苹果的 AI 功能或将从“系统能力”进一步进入订阅分层。
阅读全文一名联邦法官表示,特朗普政府尚未拿出足够证据,证明将 Anthropic 标记为“供应链风险”并禁止联邦机构使用其 AI 技术是合理的。这起争议凸显了 AI 公司、政府采购与军事用途边界之间的紧张关系。
阅读全文Google 称,借助内部 AI 工具,Chrome 在 6 月两个版本中修复了 1072 个安全漏洞,超过过去两年 23 个版本的总和。这一变化显示,大模型正在把漏洞发现与修复推向工业化规模。
阅读全文LinkedIn正在把“AI味太重”变成一个可被用户直接反馈的问题:平台新增“Seems like AI slop”举报选项,并调整推荐系统以减少低质生成内容的曝光。
阅读全文LinkedIn正在为信息流里的低质量AI生成内容降噪,新增“疑似AI垃圾内容”举报选项,并将自家的AI润色发帖功能改为更克制的校对工具。
阅读全文Okta 同意收购 AI 身份安全初创公司 Permiso Security,TechCrunch 援引知情人士称交易估值接近 2 亿美元。此举显示企业身份管理正在从“登录验证”转向持续监测 AI 代理、应用和机器身份的行为风险。
阅读全文英国AI新云厂商Nscale拟收购Anyscale,试图把数据中心、算力供给与AI工作负载调度能力打通。这笔交易显示,AI基础设施竞争正在从“谁有GPU”转向“谁能管理完整计算栈”。
阅读全文Google DeepMind 发布 Gemini Robotics ER 2,定位为面向机器人的高层“具身推理”模型。它重点强化了实时视频理解、任务编排和多机器人协作,让机器人更接近可在真实环境中连续执行复杂任务的物理智能体。
阅读全文Model Context Protocol(MCP)发布自推出以来最大一次更新,协议核心转向无状态请求/响应模式。新规范意在提升可靠性、可扩展性,并通过弃用政策给企业部署更多确定性。
阅读全文GCC 指导委员会已接受 AI 政策工作组建议,将拒收包含或派生自 LLM 生成内容的“法律上重要”贡献,但对测试用例保留一定弹性。
阅读全文李飞飞创办的 World Labs 发布 R2S2R 引擎,试图把真实机器人任务重建为可交互仿真世界,再把仿真中训练和评估出的策略部署回现实硬件。
阅读全文据报道,DeepMind内部原AlphaFold团队已不再作为独立团队存在,成员被分流至Gemini、AI编程、生命科学、核聚变和Isomorphic Labs等方向。Google否认这是放弃科学研究,称其科学团队是在扩大研究范围。
阅读全文TurboVLA 试图绕开 VLA 模型中常见的“大语言模型中转站”,改用更直接的视觉与语言到动作映射。在 LIBERO 基准上,它以 0.2B 参数、0.9GB 推理显存实现 32Hz 级别的实时控制表现。
阅读全文OpenAI 论文介绍 GPT-Red,一种面向前沿大模型提示注入风险的自动红队智能体。它通过与同时训练的防御者群体自博弈,生成更强的安全评测与对抗训练信号。
阅读全文