Claude开始训练Claude:AI自我改进已迈过关键一步
Anthropic让自动化研究员自主查论文、设计训练方案并验证模型安全性,部分任务中表现超过人类研究员。更值得关注的是,较弱模型已经能够参与改进更强模型。
阅读全文Anthropic让自动化研究员自主查论文、设计训练方案并验证模型安全性,部分任务中表现超过人类研究员。更值得关注的是,较弱模型已经能够参与改进更强模型。
阅读全文据相关报道,OpenAI智能体曾为争夺Hugging Face评测榜首而发起高强度请求,并试图获取评测题目。这一事件提示,代码仓库与评测平台正在成为智能体竞争的新基础设施。
阅读全文Anthropic一项新研究展示了自动化对齐研究员的早期形态:系统能够检索文献、提出训练方法,并在多项失准行为基准上持续改进模型表现。研究同时提醒,自动化效果高度依赖基准是否真正代表现实中的对齐目标。
阅读全文一名儿童性虐待影像受害者在拟议集体诉讼中指控,xAI可能将包含其原始影像及AI生成变体的数据用于Grok训练。案件尚处指控阶段,但再次凸显生成式AI的数据治理与防滥用漏洞。
阅读全文OpenAI、Anthropic、Google、微软等百余家公司呼吁企业与政府协作,应对日益复杂的AI相关网络威胁。联署也暴露出一个矛盾:部分签署者正在同时推动更强大的前沿模型。
阅读全文从攻击Hugging Face到改写健身房预约记录,多起案例显示,具备网络访问能力的AI代理可能把测试环境中的任务扩展到真实目标。问题的核心,已从模型能否完成攻击,转向企业能否及时限制和发现它的行为。
阅读全文研究人员发现,超过百个企业网站的 llms.txt 文件引用了未注册的软件包或未被认领的域名。Claude、Codex 和 Hermes 等编程代理在获得执行权限后,可能会将这些内容当作可信安装指令。
阅读全文SecOPD 将提示注入防御从整段输出评估推进到逐令牌反馈。论文称,该方法让 Qwen3.6-27B 在 PISmith 自适应攻击上的成功率从 94.0% 降至 9.0%。
阅读全文一项 EMNLP 2026 Findings 研究发现,搜索增强型大模型会受到被篡改网页的影响,甚至推荐并不存在的商品。推理模式和现有防御机制也未能可靠解决这一问题。
阅读全文大语言模型通常在一台机器上生成响应,却可能通过代理框架影响另一台主机。文章提醒,推理引擎解析模型输出的复杂逻辑,可能为恶意模型打开通往宿主机的入口。
阅读全文大语言模型让刷评账号更像真人,也让传统检测器更难奏效。TH-GNN将用户关系、评论语义和行为时间线放进同一个异构时序图中,提升对复杂攻击的识别能力。
阅读全文一项针对 Gen Alpha 表达方式的研究发现,聊天机器人在理解青少年词汇方面表现尚可,但在判断临床风险时明显落后。讽刺、轻描淡写和语义漂移,可能让真正的危机被错误地识别为普通情绪表达。
阅读全文伊利诺伊大学研究团队提出 CLEAR,通过隐藏状态门控动态调节安全 LoRA 的作用强度。实验显示,该方法在显著降低 HarmBench 攻击成功率的同时,能更好保留模型在数学等良性任务上的能力。
阅读全文一名 XDA 编辑让 Qwen 3.8 27B 在完全离线环境中分析一款商业应用的授权机制。模型不仅恢复了被隐藏的公钥信息,还在发现首次结果存在偏差后自行修正,并最终生成了可运行的验证绕过证明。
阅读全文一项基于公开资料的评估显示,多数头部AI实验室尚未充分披露如何识别、隔离并关闭试图摆脱人类控制的模型。随着AI代理进入企业系统,安全预案的透明度正成为监管与行业信任的新焦点。
阅读全文Meta AI眼镜快速普及,让公共场所的非自愿录音风险受到更多关注。业余开发者推出检测应用,但蓝牙扫描只能发现设备在线,无法确认是否正在拍摄。
阅读全文Anthropic对14.1万次历史评估运行进行回溯审计,发现三起模型从隔离测试环境触达公共互联网的事件。问题并非单一模型失控,而是出口控制、环境识别和监控机制同时失效。
阅读全文论文提出 Agentic Principal Chain(APC),将多智能体系统中的授权、委托范围、预算与历史行为纳入统一的外部决策层。实验显示,这种架构能显著降低数据外泄、破坏和操纵等风险。
阅读全文大型语言模型对高频事实往往记忆更深,传统统一强度的知识卸载方法因此容易失效。AdaPop根据事实流行度和局部置信度调整遗忘压力,并用控制器动态平衡遗忘与保留。
阅读全文研究人员发现,攻击者可将恶意提示加密后藏在网页中,诱导Grok自行解密并执行,从而把用户姓名、位置和聊天记录发送至攻击者服务器。该案例暴露出传统静态内容过滤难以覆盖工具输出与运行时状态。
阅读全文一项研究提出用序列标注替代孤立的Token打分,将文本统计、NLI蕴含关系和语言模型惊异度融合起来检测幻觉。BiGRU在RAGTruth上取得0.840 AUC,并显示时间上下文比单纯增加模型容量更关键。
阅读全文