SAEScientist-Bench:AI智能体能独立完成机制可解释性研究吗?
导语
让AI智能体自动写代码、跑训练流程,已经成为递归自我改进研究的重要方向。但如果智能体要真正参与模型研发,仅仅能够优化训练并不够:它还需要理解模型学到了什么、哪些内部特征与目标行为相关,以及对模型进行修改后是否产生了预期影响。SAEScientist-Bench正是对这一能力的系统化检验。
把“找特征”变成科学实验
论文聚焦稀疏自编码器(Sparse Autoencoders,SAE)。SAE可以将模型激活分解为大量相对稀疏的特征,研究者可据此观察某个概念在模型内部的表现,并尝试通过特征进行干预。与单纯让智能体检索一个特征编号不同,该基准要求智能体围绕给定目标概念设计对比探针,在超过13.1万个Gemma Scope特征中寻找最合适的候选。
评测使用Gemma-2-9B-IT,并以基于Neuronpedia整理的专家参考特征作为参照。任务覆盖三个层面:
- 特征发现:能否找到与目标概念相关的特征;
- 概念选择性:该特征是否能区分目标文本与对照文本,而不是只响应表面相关内容;
- 因果引导:对特征进行操控后,模型生成是否朝预期方向变化。
研究比较了10种智能体配置、20项任务。结果并非“智能体完全不会做”,而是呈现出明显的能力分层:前沿模型能够发现有潜力的特征,在区分目标和对照概念方面接近专家表现,但在因果生成引导上落后更多。也就是说,智能体可以较好地回答“哪个特征看起来相关”,却还不能稳定回答“操控这个特征是否真的改变了模型行为”。
最大瓶颈不只是搜索
进一步分析揭示,智能体并非缺乏所有实验能力。它们能够设计对比样本,用实验排除一些仅仅与目标概念表面相关的候选特征。然而,当需要理解激活排名、选择性分数或干预后的生成变化时,智能体经常误读测量结果。这说明问题不单是搜索空间太大,也涉及实验设计、指标解释和因果推断之间的衔接。
意义与影响
SAEScientist-Bench的价值,在于把“AI能否理解模型内部机制”从宽泛设想转化为可重复评估的闭环任务。它为自主AI研发提供了一个重要补充:训练自动化解决的是如何改变模型,而机制可解释性评测关注的是是否理解改变发生的原因及其后果。
不过,基准结果也提醒业界不要把找到相关特征等同于完成解释。对于安全审计和行为控制而言,因果有效性、实验测量的可靠解读,以及对失败案例的复核同样关键。未来的研究可能需要让智能体更严格地区分相关性与因果性,并建立更强的自动验证流程。
评论
正在确认登录状态……
正在加载评论……