返回文章列表
代码智能体

Frontis-MA1:把机器学习工程变成 AI 自我改进试验场

阅读约 2 分钟

导语

“递归自我改进”(RSI)常被讨论为通往更强 AI 的关键路径,但难点在于:如何把“AI 改进 AI”变成可执行、可评测、可复现的研究问题。FrontisAI 的论文将切口放在机器学习工程(MLE)上:让模型在真实代码、训练脚本、报错反馈和榜单指标中学习如何改进模型开发流程。

论文提出的核心成果包括开放系统 OpenMLE,以及在其上后训练得到的 35B 参数模型 Frontis-MA1。它不是单纯回答问题的聊天模型,而是被设计成一个“元进化代理”:通过不断生成、修改、调试和组合程序,推动机器学习方案迭代。

核心要点

  • OpenMLE 是一套完整试验栈:系统包含 OpenMLE-Gym、OpenMLE-RL 和 OpenMLE-Evo。前者提供带执行反馈的可验证任务环境,中间层负责基于操作符的学习,后者负责长周期搜索。
  • 训练与推理围绕同一组操作符对齐:Frontis-MA1 使用四个原子程序进化操作——Draft、Improve、Debug、Crossover。也就是说,模型训练时学的能力,与推理时用于搜索和迭代的动作保持一致。
  • 强调执行反馈而非静态文本学习:论文称其通过带执行结果的 SFT 和 RL 数据进行后训练,并对评测基准做去重,以降低数据泄漏风险。
  • 长程搜索是性能提升关键:在 MLE-Bench Lite 上,Frontis-MA1 结合 OpenMLE-Evo 后,Medal Average 从基座模型的 39.39% 提升到 60.61%;使用 OpenMLE-Evo-Max 后达到 71.21%。
  • 迁移结果显示框架与模型各有贡献:在保留 NatureBench Lite 作为 held-out 测试时,固定框架换入训练后的模型,Match-SOTA 从 50% 提升到 70%;固定模型换入 OpenMLE-Evo,则从 20% 提升到 50%。

意义与影响

这项工作最值得关注的地方,并不只是单个模型分数,而是它把 AI4AI 研究拆成了可工程化的闭环:环境提供执行反馈,模型学习可复用的程序进化动作,搜索系统把短动作组合成长周期策略。相比只评测代码补全或问答能力,这更接近机器学习工程师的真实工作流。

当然,摘要中的结果仍需要结合完整论文、代码复现和基准设置来判断。尤其是 OpenMLE-Evo-Max 引入了经验先验和异步搜索,其性能提升不应只归因于模型本身。但如果开源权重和完整 OpenMLE 栈能被社区充分验证,它可能为研究“AI 如何改进 AI 开发过程”提供一个更具体的公共平台。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
让代码模型不只写对,还要写快:Meta 论文探索面向代码优化的强化学习
代码智能体
cctest.ai
代码智能体

让代码模型不只写对,还要写快:Meta 论文探索面向代码优化的强化学习

这篇论文讨论了一个更难的代码智能目标:不仅让模型生成能通过测试的程序,还要让它学会生成运行更快的程序。研究指出,执行时间作为奖励信号看似直接,实际却会被噪声、稀疏奖励和训练不稳定性放大。

阅读全文