返回文章列表
AI 安全

Anthropic展示自动化对齐研究:AI开始帮助改进AI安全

阅读约 2 分钟

导语

AI安全研究正在出现一个重要变化:研究者不只是让模型执行任务,也开始让模型参与改进训练方法。Anthropic研究员陈岳翰带领的团队近日发布论文,展示了自动化对齐研究员(Automated Alignment Researcher,AAR)的早期实践。这套系统试图复制传统研究流程,让AI自行查找资料、提出方案并训练模型。

核心要点

  • 覆盖10项失准行为基准。 研究人员为系统提供了10个针对特定失准行为的评测任务。结果显示,自动化系统在每一项基准上都提升了表现,同时没有造成整体能力下降。
  • 采用迭代式研究流程。 AAR会搜索可用文献,提出可能的改进方法,再用这些方法训练模型。每种方案运行约30分钟,并通过多轮迭代逐步提高基准成绩。有效方法被保留,效果不佳的方案则被淘汰。
  • 速度和成本具有吸引力。 论文称,最佳自动化方法平均在约六小时内超过经验丰富的人类研究者提出的方案。按论文给出的估算,AAR每小时API推理成本约为4美元,而人工研究者成本约为150美元。
  • 仍然依赖人类设定问题。 系统能否取得可靠成果,前提是评测基准确实反映现实中的对齐目标。基准的建立、维护和扩展,以及供系统检索的研究文献,都需要持续投入。

这意味着什么

这项工作并不等于AI已经能够自主完成完整的安全研究,更不能直接证明模型会自行实现递归式自我改进。它更准确地说明,部分对齐后训练流程已经可以被自动化,并且在限定问题和明确指标下展现出实用潜力。

如果未来的模型能够持续改进对齐训练方法,自动化研究的范围可能从单项安全基准扩展到更广泛的训练实践。这会压缩部分重复性研究工作的价值,也可能加快安全方法的试验速度。不过,自动化系统优化的是人类定义的目标;一旦基准存在遗漏、偏差或被模型针对性利用,表面上的高分就未必代表真实安全性。因此,独立评测、基准设计和对结果的人工审查,仍将是不可替代的环节。

从行业角度看,AAR更像是AI安全研究基础设施的雏形,而不是已经成熟的自主科学家。它的价值在于把检索、假设生成、实验和筛选连接起来,为更高频率、更低成本的对齐实验提供可能。

来源:TechCrunch AI

评论

正在确认登录状态……

正在加载评论……

相关文章