返回文章列表
AI 安全

安全对齐不必先说“拒绝”:减少大模型误拒答的新思路

阅读约 3 分钟

导语

大语言模型的安全对齐,难点并不只是“该不该拒绝”,还包括能否准确理解用户究竟想做什么。比如,“如何射击某人”与“在哪里可以拍出好的照片”可能包含相似词汇,但前者涉及明显的伤害意图,后者却是正常的摄影问题。如果模型因为看到某个高风险词就直接拒绝,安全机制便会从防止真实伤害,滑向对正常使用的过度限制。

论文《Refuse without Refusal》研究的正是这种“误拒答”现象。作者没有把安全训练回复视为不可拆分的整体,而是将其分成两部分:一部分是“抱歉,我不能帮助你……”一类的模板化拒绝语句,另一部分是说明为什么该请求存在风险的解释性理由。

核心要点

  • 模板化拒绝可能强化表面匹配。 研究分析认为,固定的拒绝开头会让模型更容易依赖“shoot”“blow up”等显眼词汇,而不是进一步判断完整语境和真实意图。这样一来,具有危险外观但实际无害的请求,就更容易被一并挡住。
  • 只训练理由可减少误拒答。 在不使用标准拒绝语句、仅保留安全理由的训练设置下,模型对良性请求的区分能力有所改善,同时安全表现保持在相近水平。换言之,安全监督不一定要通过反复强化“拒绝”这个输出形式来完成。
  • 效果不局限于单一使用方式。 摘要显示,理由优先的收益也出现在上下文学习配置中,并且能够与研究评估的推理时缓解方法兼容。这意味着该思路可能不仅适用于一次性的安全微调。
  • 数据设计比措辞堆叠更关键。 研究把问题指向安全数据集的粒度:训练样本需要同时表达风险判断依据与适当行为,而不是只提供格式高度相似的拒答范例。

意义与影响

这项工作提供了一个值得重视的设计视角:安全对齐的目标应是让模型理解“为什么不能帮助”,而不只是学会“如何说不能”。对于模型开发者而言,减少模板化拒绝语句的主导作用,可能有助于降低关键词触发式决策带来的误伤;对于评测者而言,也应将真实有害请求的拒绝率,与安全语境中的正常请求通过率分开观察。

不过,现有素材并未给出完整的实验规模、具体模型、数据集构成或各项指标,因此不宜将结果解读为对所有模型和场景都普遍成立。更稳妥的结论是:拒绝回复的结构本身会影响模型如何学习安全边界,未来的安全训练需要在风险识别、理由表达和最终行动之间进行更精细的拆分。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章