菲尔兹奖得主 Tsimerman 加入 OpenAI:顶尖数学家转向 AI 安全
据 OSChina 摘要,2026 年国际数学家大会公布本届菲尔兹奖得主后,雅各布·Tsimerman 宣布将转向 AI 安全研究并加入 OpenAI。这一动向凸显基础数学人才正在进入 AI 安全前沿。
阅读全文据 OSChina 摘要,2026 年国际数学家大会公布本届菲尔兹奖得主后,雅各布·Tsimerman 宣布将转向 AI 安全研究并加入 OpenAI。这一动向凸显基础数学人才正在进入 AI 安全前沿。
阅读全文TechCrunch 采访多位进攻性网络安全研究者发现,OpenAI、Anthropic 等模型的安全护栏,正在让部分合法防御工作变得更慢、更绕、更不稳定。
阅读全文SeerGuard 针对移动端 GUI 代理的安全痛点,提出了一套执行前防护框架。它通过指令筛查和动作风险评估,把危险操作拦在真实设备受损之前。
阅读全文Grab 为自治型 AI 工作负载构建了 Palana 平台,用 Kubernetes、零信任隔离、代理鉴权和审计机制,为不可预测的智能体行为设置可控边界。
阅读全文多起 AWS 事件显示,AI 智能体或生成式 AI 凭证一旦失控,费用可以在账单系统反应前迅速放大。传统按日刷新的预算告警,已经难以覆盖 API 级消费的实时风险。
阅读全文TikTok 正在美国部分创作者中测试一项自愿启用的 AI 肖像检测工具,用于发现可能冒用本人形象的生成式内容。通过身份验证后,创作者可查看系统扫描结果,并向平台举报可疑帖子或账号。
阅读全文在多起围绕Grok生成不当性图像的争议后,xAI首次起诉一名被指利用Grok制作儿童性虐待材料的用户。这起诉讼不只是追责个案,也是在为AI平台责任边界争取法律解释。
阅读全文OpenAI 关于青少年使用 ChatGPT 的立场,核心并非放任使用,而是在年龄适配的保护、学习场景设计、家长控制与专家合作之间寻找平衡。对教育与 AI 安全行业来说,这反映出未成年人 AI 产品治理正在从“能不能用”转向“如何安全地用”。
阅读全文Hugging Face 披露一起生产基础设施入侵事件,称攻击由自主 AI 代理系统端到端执行,并利用数据处理链路中的代码执行路径取得初始立足点。事件凸显 AI 平台的数据与模型表面已成为关键攻击面,防守也需要可控的本地 AI 能力。
阅读全文一篇 arXiv 论文提出,AI 赋能系统的渗透测试不能只看服务器、配置或权限是否被攻破,还要评估攻击者能否通过提示、检索内容、传感器输入或工具调用影响系统行为。其核心是把测试目标从资源 compromise 扩展到运营目标被违反。
阅读全文一篇新论文把“组织能从审计对象选择中反推举报者”的风险形式化,并提出基于持续计数的私密审计机制。研究显示,简单随机响应在这一场景下几乎无法比均匀随机审计更有用。
阅读全文一篇 arXiv 新论文提出 TA-RS,用随机平滑为基于大语言模型的网络入侵检测系统提供可认证鲁棒性。其关键思路是只在攻击者可直接操控的流量特征子空间中注入噪声,而不是无差别扰动全部特征。
阅读全文这篇 arXiv 论文提出 CAVA,将不同运行环境中的智能体操作转换为规范化行动对象,以便治理系统能够核验“批准了什么、执行了什么”。它关注的是智能体运行时治理中最基础但常被忽视的一环:行动身份的一致性与可复现性。
阅读全文OpenAI 发布安全研究 GPT-Red,展示如何用自博弈强化学习训练自动红队模型,持续发现提示注入等漏洞。该系统已被用于提升 GPT-5.6 的鲁棒性,但仍作为内部工具保留。
阅读全文