Repo-To-Skill:把 GitHub 仓库提炼成 AI 研究技能
导语
让 AI 智能体独立完成机器学习研究,难点并不只在于理解论文或生成代码。一个方法能否真正运行,往往取决于数据处理、配置方式、训练细节、评估流程以及对常见失败模式的判断。这类知识通常散落在 GitHub 仓库、脚本和文档中,默认读者是人类开发者,既不适合一次性装入上下文,也难以在不同任务之间直接复用。
论文《Repo-To-Skill》将这部分经验称为“操作性知识”,并提出 DisCo:一个能够创建和使用技能的研究型智能体。其核心思路,是把大型代码仓库中的实践路径提炼成紧凑、经过验证的技能模块,在需要时提供给智能体调用。
核心要点
- 补上智能体的知识缺口:传统研究智能体通常由模型、规划、执行、记忆和验证机制组成,但“如何让一个方法在真实环境中工作”的领域经验往往位于系统之外。技能层试图连接抽象方法与具体执行。
- 两种蒸馏方式:DisCo 一方面从广泛使用的机器学习仓库中提炼与任务无关的通用技能;另一方面根据具体研究任务,生成该任务所需的定向技能。前者适合建设公共能力库,后者更强调即时适配。
- 形成规模化技能库:论文介绍的 AREX-Skill Library 从 1,000 个广泛使用的机器学习仓库中提炼出 5,000 多项经过验证的技能,覆盖 20 个领域和 178 个能力族。
- 在固定条件下进行比较:在 GPT-5.5 模型、研究 harness 和下游执行预算保持一致的条件下,加入技能的智能体在 MLE-bench、PaperBench、FrontierCS 和 PassNet 上分别取得更高成绩。摘要给出的提升幅度依次为 134.3%、34.4%、9.2% 和 14.0%。
意义与影响
这项工作的重要性,在于它重新定义了“给智能体更多知识”的方式。与其把整个仓库或大量文档直接塞进上下文,不如先提炼出带有适用条件、操作步骤和验证结果的能力单元。这样既能减少检索和重复试错,也有望让不同研究任务共享同一套工程经验。
不过,技能库并不等于静态知识库。代码依赖、工具接口和最佳实践会持续变化,技能是否仍然有效,需要长期更新和重新验证。类似地,技能生成过程本身也必须受到质量控制,否则错误经验可能被压缩成更容易传播的自动化流程。因此,未来评估不应只看一次任务的得分,还要关注技能的可迁移性、时效性、可解释性与失败边界。
从更广视角看,Repo-To-Skill 展示了一条将开源生态转化为智能体能力的路径:仓库不只是可供模型阅读的资料,也可以成为可编译、可调用和可验证的操作知识来源。
评论
正在确认登录状态……
正在加载评论……