AISPA:把“系统提示词”纳入用户视角的安全审计
导语
大模型应用的“性格”和边界,往往不是只由基础模型决定,还由开发者写入的系统提示词塑造。它们会规定模型该如何回答、何时拒答、如何处理用户隐私与风险。但在真实商业产品中,这些提示词通常对用户不可见,也很少接受外部审查。论文《AISPA: User-Centric System Prompt Auditing for Large Language Model Applications》关注的正是这一透明度缺口。
研究团队提出 AISPA(Artificial Intelligence System Prompt Assurance),希望把系统提示词从“开发者内部配置”变成可被系统化检查的对象。它不是简单评价提示词写得好不好,而是从用户利益出发,审视提示词中的具体指令是否在保护用户,或是否可能与用户利益相冲突。
核心要点
- 审计对象更细粒度:AISPA 将系统提示词拆解为具体指令,并沿八个与用户相关的维度进行评估,而不是只给整个产品打一个笼统标签。
- 样本来自商业应用:研究审查了 88 个商业 AI 产品中的 3249 条系统提示词指令,并将其归类为“保护性”或“问题性”。
- 产品差异显著:不同公司和产品的系统提示词设计差别很大。有些组织平均每个产品包含 60 条以上保护性指令,而有些组织平均少于 5 条。
- 保护性指令普遍但不充分:98.9% 的产品至少包含一条保护用户的指令,但只有 24% 覆盖 AISPA 分类体系的全部八个维度。这说明“有安全提示”并不等于“保护全面”。
- 提示词正在变长、也更强调保护:论文观察到,系统提示词整体呈现更长、更重视用户保护的趋势,显示商业 AI 设计中用户保护议题正在变得更显性。
- 问题仍未消失:约 40% 的产品至少包含一条违背用户利益的指令,而且保护性与问题性指令经常出现在同一份提示词中。
意义与影响
这项研究的重要性在于,它把系统提示词从“隐藏工程细节”提升为 AI 治理对象。过去,外界评估 AI 产品多关注模型能力、输出质量或安全测试结果,但系统提示词本身同样会影响用户权利、信息透明度和产品责任边界。
AISPA 的价值不只在于发现问题,也在于提供一种共同语言:开发者可以据此检查产品缺口,用户和研究者可以更清楚地讨论“AI 应用到底被怎样设定”,监管者也能据此思考披露、标准化和第三方审计机制。
不过,论文也提醒我们,商业 AI 的安全承诺不能只看是否写入了几条保护性规则。真正关键的是覆盖范围、执行一致性,以及是否存在与用户利益相冲突的隐藏指令。随着 AI 应用越来越深入工作、教育和生活场景,系统提示词透明化可能会成为模型治理中不可绕开的议题。
评论
正在确认登录状态……
正在加载评论……