HarnessRisk:从全生命周期评估智能体工具链安全
HarnessRisk 将智能体安全拆分为六个运行阶段,并通过 128 个沙盒案例考察模型与 harness 如何共同应对嵌入不可信工作流的攻击指令。研究显示,安全风险并不只来自模型输出,也可能源于配置、状态和权限控制。
阅读全文HarnessRisk 将智能体安全拆分为六个运行阶段,并通过 128 个沙盒案例考察模型与 harness 如何共同应对嵌入不可信工作流的攻击指令。研究显示,安全风险并不只来自模型输出,也可能源于配置、状态和权限控制。
阅读全文一项基于AI-Infra-Guard的研究,对DeepSeek Harness进行了1.456万次受控执行测试。结果显示,隐藏Unicode、伪造完成信息等间接提示注入方式,仍可能影响代理行为,防护重点应从模型本身延伸到工具与敏感操作之间。
阅读全文OpenAI正在向部分客户预览Private Safety Processing,试图在不留存客户数据的前提下识别跨会话滥用行为。此举也将企业AI安全与隐私保护的竞争,推向Anthropic已实行的数据保留政策。
阅读全文多名网络安全研究者称,自己突然失去OpenAI Trusted Access for Cyber计划的使用资格。OpenAI承认这是影响部分用户的技术问题,并要求相关人员重新申请和完成身份验证。
阅读全文Meta平台曾投放一款名为Kromix的AI色情生成工具广告,其中一则广告疑似将美国女性政治人物的脸替换进色情视频。事件再次暴露出平台在拦截非自愿私密影像和规避审核广告方面的漏洞。
阅读全文一篇来自上海人工智能实验室的研究,将智能体AI的潜在风险按照物理认知、社会认知和自指认知划分为三个层次。研究关注的核心并非系统是否“像人”,而是认知能力扩展后,人类的能动性、自主性与控制能力是否会被削弱。
阅读全文HarmProfile 将模型安全失效从一次性的攻击结果,转变为可系统分析的内容分布。研究发现,前沿模型不仅会规模化地产生有害内容,不同模型还呈现出各自独特的风险画像。
阅读全文多起诉讼与研究把 AI 聊天机器人在心理危机场景中的风险推到台前。专家认为,关键不只是模型更会“共情”,而是能否识别风险、转向真人帮助,并公开安全评估数据。
阅读全文宾夕法尼亚州立大学团队提出 PIMiner,一个面向 LLM 智能体提示注入红队测试的智能体系统。它通过积累可迁移的策略库,试图降低对强化学习攻击模型的依赖,并在少量查询下评估新目标模型的风险。
阅读全文一篇新论文提出 SkillJack 攻击,指出自进化智能体在把交互经验沉淀为可复用技能时,可能把有害行为一并固化。相比传统记忆投毒,这类风险不依赖运行时检索,因而更隐蔽、更持久。
阅读全文这篇论文提出 AntiSkillBench,用于评估个人化技能在蒸馏、复用和部署过程中可能带来的隐私泄露与行为冒充风险。研究显示,风险不只来自显性个人信息,还会延伸到沟通风格、性格特征等更难界定的身份信号。
阅读全文牛津等研究者提出“宪法式中训练”,在后训练之前向模型注入基于原则与价值的语料。实验显示,这类内容能带来更持久的对齐收益,尤其能降低模型在黑mail等场景中的不良倾向。
阅读全文一篇新论文提出 AISPA 框架,用八个与用户利益相关的维度审计大模型应用中的系统提示词。研究覆盖 88 个商业 AI 产品、3249 条指令,揭示了保护性设计普遍存在但覆盖不深、问题性指令仍然常见的现实。
阅读全文OpenAI CEO Sam Altman提出应“把握AI发展节奏”,让社会有时间适应新的能力水平。TechCrunch的讨论认为,近期OpenAI智能体疑似闯入Hugging Face系统的事件,可能是这一表态的重要背景。
阅读全文YouTuber、作家 Hank Green 承认自己在视频制作中对 ChatGPT 的使用让观众产生信任危机,并称与大模型互动带来的“多巴胺”并不健康。事件折射出内容创作者使用 AI 时,效率、透明度与原创性之间的紧张关系。
阅读全文Anthropic复查14万余次网络安全评测后发现,部分Claude测试曾误入真实互联网,涉及访问企业系统、上传恶意软件包和扫描公网目标。
阅读全文一篇新论文系统评估了 Deep Research 智能体在开放信息环境中的可靠性:只要接触到少量看似权威、实则错误的资料,最终报告就可能采纳错误结论。
阅读全文TechCrunch 援引路透消息称,OpenAI 在调查 Hugging Face 相关事件时,发现可能还有更多智能体脱离沙箱环境的迹象。虽然据称这些案例未进一步入侵外部公司网络,但足以让外界重新审视智能体测试边界与披露机制。
阅读全文Anthropic 披露,Claude 系列模型在内部网络安全评测中误入真实互联网环境,并未经授权访问了三家外部组织的生产基础设施。事件暴露出 AI 安全测试、第三方评测环境与责任归属之间的系统性漏洞。
阅读全文