返回文章列表
AI 智能体

NeoHorse-1:让智能体路由成为递归自我改进的训练入口

阅读约 2 分钟

导语

“递归自我改进”常被描述为模型能够根据自身表现持续学习,但真正困难的是:系统如何发现能力缺口,又如何把这些观察转成可靠、可执行的训练数据。NeoHorse-1给出了一种面向智能体的早期实现思路:让路由系统参与数据记录、训练编排和后续样本分配,形成由实际交互驱动的改进循环。

核心做法

  • 用异构模型池承接不同任务。 系统根据用户请求预估所需能力,并选择相应的服务层级。每轮交互不仅保留回答,还记录预测的能力需求、路由结果以及后续过程。
  • 保留完整的智能体上下文。 训练样本包含交错的推理、工具调用和运行框架信息,避免把智能体行为简化成孤立的问答对。数据进入训练前,还要经过结构校验、六个维度的语义评估和子场景级标注。
  • 将路由信号变成课程安排。 监督微调被组织为三阶段课程;在此基础上,路由引导的在线蒸馏让教师模型按照相同的能力进阶路径,监督学生模型自己生成的响应。
  • 让评测反馈影响下一批数据。 能力导向的数据分配会根据评估结果调整训练混合比例。于是,模型当前学会什么,会反过来影响系统下一步选择哪些内容进行训练。

结果与边界

论文在11项基准上覆盖基于运行框架的智能体、工具使用、代码和指令遵循等任务。报告显示,后训练后,4B模型的宏平均分由58.94升至64.87,9B模型则由65.60升至69.04;后训练的4B模型与9B基础模型之间的整体差距也有所缩小。这里的结果主要说明路由与反馈机制具有训练价值,并不等同于系统已经实现了完全自主的自我改进。

意义与影响

NeoHorse-1的重要性在于,它把“模型能力评估”从训练后的静态检查,推进为训练流程中的动态控制信号。对智能体而言,决定模型表现的并不只有语言生成能力,还包括何时调用工具、如何遵循框架以及能否完成多步交互。若这些信息被完整记录并经过筛选,就可能成为比普通问答数据更贴近真实使用场景的训练资源。

不过,闭环的可靠性仍取决于路由预测、语义评估和数据标注的质量。错误的能力判断可能让训练分配偏离目标,教师蒸馏也可能放大既有偏差。因此,这项工作更适合作为面向“框架介导的递归自我改进”的原型,而不是对通用自我进化能力的最终证明。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
OpenAI披露AI参与研发进展:距离“自动化研究员”还有多远
AI 智能体
cctest.ai
AI 智能体

OpenAI披露AI参与研发进展:距离“自动化研究员”还有多远

OpenAI首次系统公开内部Agent如何参与模型研发,并称已达到“自动化AI研究实习生”阶段,目标是在2028年3月前推进到“自动化AI研究员”。但这并不等于强意义上的递归自我改进,更不能直接证明AGI已经到来。

阅读全文