文章与教程

AI 安全

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 100 篇文章

CCTest · Blog
长上下文正在削弱安全护栏:LongGuard 找到失效机制与免训练修复方案
AI 安全
cctest.ai
AI 安全

长上下文正在削弱安全护栏:LongGuard 找到失效机制与免训练修复方案

一项名为 LongGuard 的研究发现,当安全护栏面对更长文本时,危险内容的召回率会显著下降。研究进一步将问题定位到“注意力稀释—分类边际压缩—检测崩溃”这一机制链,并提出无需训练的缓解方法。

阅读全文