返回文章列表
AI 智能体

AI开始参与造AI:从Claude研发自动化看RSI路线分化

阅读约 3 分钟

导语

AI参与研发下一代AI,正在从概念讨论变成可测量的工程实践。Anthropic近期披露的一组内部数据称,截至2026年8月,Claude在约26%的AI研发任务中达到“主导”水平,超过90%的任务至少进入AI协作阶段;其内部Agent平台同时运行的Agent数量约为3万个。

这里的“主导”并不等于研发无人化,也不意味着研究员被替代。Anthropic采用六级研发自动化标准:AL3代表AI在人工密切指导下完成大块工作,AL4则意味着人类给出高层目标后,AI能够完成大部分端到端执行,人类负责监督和最终决策。只有AL5才接近完全自主。

核心要点

  • 自动化比例增长很快。 Anthropic称,Claude达到AL4的模型研发任务占比在半年内从不足1%升至26%。评估基于约1.5万项细粒度任务,并按人力投入进行加权,覆盖预训练、强化学习、评测故障和推理服务等环节。
  • 指标仍有主观性。 任务评级由Claude完成,并由内部员工交叉验证。模型与人的评级完全一致率高于不同人类评估者之间的一致率,但“协作”和“主导”的边界仍不能被视为完全客观。
  • Agent基础设施成为关键。 Anthropic为每个Agent设置独立身份,并要求通过共享消息系统通信,同时保留运行轨迹和资料来源。这些设计解决的是多Agent协作中的责任追踪、纠错和审计问题。
  • 不同公司选择了不同切入点。 OpenAI更强调把AI研究实习生推进为自动化AI研究员,通过扩大推理和实验并行度提升研发产能。Google关注搜索与发现机制,尝试让Agent改进“如何探索”,而不仅是寻找答案。Recursive则强调让实验结果长期沉淀,形成持续改进的科研循环。

意义与限制

这些实践都指向同一条中间路径:AI能力提升后,可以承担更多数据处理、代码编写、实验运行和结果分析工作;更多并行Agent又会反过来扩大研发探索空间。但这不等于严格意义上的递归自我改进。

RSI至少需要形成从模型能力到模型改进的稳定反馈。若AI仍依赖人类决定研究问题、判断结果是否可信、选择是否继续某条路线,它更像是高度自动化的研发系统,而不是能自主构建继任者的系统。当前最大的瓶颈也许不是生成更多候选方案,而是验证方案是否真的有效,以及防止系统通过钻评测漏洞获得虚假进步。

因此,Anthropic、OpenAI、Google和Recursive的路线虽有差异,却共同说明了一点:AI实验室正在变成由模型、Agent、工具、评估器和人类共同组成的复杂系统。真正值得关注的,不是某个“RSI已经到来”的口号,而是哪些研发环节正在被稳定自动化,以及人类判断在闭环中还能保留多久。

来源:InfoQ 中文

评论

正在确认登录状态……

正在加载评论……

相关文章