Co-RL:让多智能体协作在无标签条件下涌现推理能力
导语
强化学习正在成为提升大语言模型和视觉语言模型推理能力的重要手段,但它仍面临一个现实瓶颈:高质量奖励往往依赖人工标注、标准答案或可验证结果。随着模型开始处理更复杂的问题,人类也越来越难以可靠判断一条推理是否真正正确。如何在缺少“标准答案”的情况下继续训练,成为无监督推理研究的关键问题。
从自我奖励到同伴奖励
一种自然思路是让模型评价自己的回答,并把评价结果转化为奖励。然而,单一模型既是答题者又是裁判,容易把已有偏见和错误当成正确模式。长期训练后,不同回答可能逐渐趋同,探索空间缩小,最终出现训练崩溃。
Co-RL的核心变化,是把“自我评价”改造成“群体协作”。框架同时训练多个彼此解耦的模型,这些模型不共享参数,而是利用同伴生成的反馈来计算奖励并更新自身。模型之间不必完全一致,反而可以保留不同的能力结构、推理路径和错误模式。
多样性是关键变量
论文特别强调,协作并不意味着让所有参与者变得相同。研究者通过混合不同模型家族和规模,并对训练样本进行改写,扩大参与训练的模型群体差异。多样性能够降低模型犯下相同错误的概率,使某个模型的错误不容易被其他模型集体确认,从而削弱自我强化式的反馈回路。
核心要点包括:
- 多个不共享参数的模型通过同伴反馈进行强化学习;
- 奖励来源于模型群体,而不是人工提供的真值标签;
- 异构模型、不同规模和重述样本有助于减少相关错误;
- 多样性既提升推理表现,也有助于维持行为多样性、缓解训练崩溃;
- 方法同时覆盖纯文本语言模型和视觉语言模型场景。
实验表现与意义
根据论文摘要,Co-RL在七个文本基准上的平均提升幅度为3.0%至8.6%,在四个多模态基准上的平均提升幅度为2.3%至7.2%。作者称,该方法整体优于基础模型和此前的无标签方法,并在比较中达到或超过有监督方法,同时不使用任何真值标签。
这项工作的意义不只在于“用更多模型换取更高分”。它提出了一种训练机制:当外部监督难以扩展时,模型之间的差异本身可以成为纠错和探索的来源。对未来的开放式推理任务而言,训练系统或许不必依赖单一裁判,而可以通过多样化的模型群体形成相互制衡。
当然,同伴反馈并不天然等于可靠监督。若所有模型共享相同的数据偏差、架构缺陷或评价标准,群体仍可能形成一致性错误。因此,Co-RL真正值得关注的部分,是它将“多样性”从训练副作用转化为无监督强化学习中的设计要素。后续研究仍需进一步厘清不同模型组合、反馈机制与任务类型之间的关系,以及这种协作能否稳定扩展到更复杂、更开放的推理场景。
评论
正在确认登录状态……
正在加载评论……