Anthropic展示自动化对齐研究:AI开始帮助改进AI安全
Anthropic一项新研究展示了自动化对齐研究员的早期形态:系统能够检索文献、提出训练方法,并在多项失准行为基准上持续改进模型表现。研究同时提醒,自动化效果高度依赖基准是否真正代表现实中的对齐目标。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 775 篇文章
Anthropic一项新研究展示了自动化对齐研究员的早期形态:系统能够检索文献、提出训练方法,并在多项失准行为基准上持续改进模型表现。研究同时提醒,自动化效果高度依赖基准是否真正代表现实中的对齐目标。
阅读全文围绕 Hugging Face、Poolside 和 OpenRouter 的多笔大型交易传闻与协议,显示开放权重模型生态正从“免费共享”走向基础设施争夺。芯片厂商、支付公司和云端企业都在试图控制模型分发、推理和开发者入口。
阅读全文美国加州北区联邦法官认定,特朗普政府因 Anthropic 拒绝放宽致命自主武器和大规模监控限制而采取的全面禁用措施,构成违宪报复。法院同时撤销了将 Anthropic 定性为国家安全供应链风险的相关指令。
阅读全文特朗普政府领导下的美国环保署拟取消部分“小型”污染源项目的联邦公众通知和评论要求。环保组织担心,数据中心及其配套电力设施可能在邻近居民不知情的情况下推进。
阅读全文Meta将更新AI眼镜:录制过程中一旦遮挡安全指示灯,摄像头就会停止工作。此举堵住了一个明显绕过方式,却没有消除非自愿拍摄、数据处理和监管审查带来的更大风险。
阅读全文面对超大规模代码变更,LinkedIn 没有简单套用现成 AI 审查工具,而是搭建了一个由多个审查智能体、规则系统和事件驱动架构组成的平台。其重点不只是生成评论,更是控制幻觉、提升信噪比并衡量建议是否真正被采纳。
阅读全文Cloudflare 发布实验性浏览器引擎 Kitesurf,试图以更低的资源开销支持 AI 智能体执行网页截图、HTML 提取等任务。它暂时无法替代 Chromium,但展示了面向智能体重新设计浏览器基础设施的方向。
阅读全文新论文提出,世界模型的扩展不应只依赖更多网络视频,还需要能持续产生可靠奖励信号的数据引擎。游戏引擎提供的碰撞、物理和可导航性检查,或能为空间智能的强化学习后训练补上关键一环。
阅读全文GameWAM 将世界模型与行动策略合并为一个闭环系统,能够根据游戏画面预测未来状态,并生成可执行的键鼠轨迹。它还探索了长时程控制和生成式动作模型中的低频偏置问题。
阅读全文美国联邦法官裁定,政府将Anthropic列为“供应链风险”的做法违法,构成对企业批评政府行为的报复。Anthropic与五角大楼的另一宗诉讼仍在华盛顿继续。
阅读全文Meta印度及东南亚副总裁桑德娅·德瓦纳坦将加入OpenAI,负责东南亚及澳大利亚的消费者增长、企业采用和监管合作。此次人事变动发生在Meta于印度面临内容安全与平台治理压力之际。
阅读全文腾讯混元推出 Hy4 preview,采用总参数 770B、激活参数 4.9B 的架构,并支持 1M 上下文。除模型开源外,官方还展示了其与游戏引擎、MCP 等工具体系结合的应用方向。
阅读全文云知声披露的2026年上半年业绩显示,企业智能化服务仍是收入主体,Token调用业务则快速增长。更值得关注的是,智能体能否通过行业复用和持续服务改善商业化效率。
阅读全文Anthropic推出处于研究预览阶段的模型硬件标准(MHS),试图像MCP连接软件一样,让Claude发现并调用机械臂、显微镜和实验仪器。它探索的不是为模型打造固定身体,而是让AI临时借用不同设备完成任务。
阅读全文高德发布流式3D重建模型ABot-Recon,以连续12帧局部画面为上下文,尝试解决长序列重建中的误差累积、速度下降和显存膨胀问题。官方称,该模型已在多个公开数据集上取得较优结果,并开放代码、权重和体验入口。
阅读全文美国一名联邦法官裁定,五角大楼将 Anthropic 指定为“供应链风险”的做法违宪,构成对企业言论的非法报复。案件源于 Anthropic 拒绝放宽军用 AI 的两项安全限制。
阅读全文VGI-Bench 将评测重点从视频画质推进到动态视觉推理,考察模型能否理解并生成符合逻辑的视觉过程。结果显示,当前系统虽已展现部分能力,但距离可靠推理仍有明显差距。
阅读全文WarpSAC 的核心观点是:离策略强化学习的最佳训练策略取决于数据供给,而不是简单追求更多稳定化机制。研究据此提出面向不同数据 regime 的 SAC 变体,并在 CPU 与 GPU 并行训练中取得改进。
阅读全文JIT-Agent将智能体的记忆、规划、行动协议和工具编排统一为可生成的运行框架,并尝试根据具体任务即时定制、修复和演化。论文显示,这种“框架智能”可以在不更换基础模型的情况下显著影响智能体表现。
阅读全文Video-IFBench 将评测重点从“答对视频问题”推进到“是否完整遵守复杂指令”,覆盖视觉、音频、语义和格式等多重约束。对20多个近期多模态大模型的评测显示,视频指令遵循仍是明显短板。
阅读全文AnTrap 将弹窗、状态卡死和动作误用等运行时异常引入 Android GUI Agent 的执行过程,系统评估智能体在动态对抗环境中的鲁棒性。研究发现,现有模型普遍会受到干扰,而深层上下文陷阱仍超出单纯训练的解决能力。
阅读全文