返回文章列表
强化学习

J-Zero:让挑战者、解题者与裁判协同进化

阅读约 2 分钟

导语

让语言模型自己提出问题、解决问题,再判断答案优劣,是减少人工监督依赖的一条重要路线。过去,这类自我进化方法在数学、代码等“有标准答案”的任务上更容易落地;一旦进入写作、开放问答等不可验证领域,模型如何获得可靠反馈便成为瓶颈。KAIST AI 团队提出的 J-Zero,试图用三个相互适应的角色,建立一套覆盖两类任务的闭环。

核心要点

  • 挑战者负责抬高难度。 Challenger 生成任务,并在与 Solver 的交互中不断制造更具挑战性的输入。Solver 则针对这些任务学习生成质量更高的回答。二者形成类似攻防的关系:挑战者推动能力边界,解题者负责追赶。
  • 裁判不再完全固定。 J-Zero 的关键变化是让 Judge 也参与进化。传统方案往往使用冻结的评估模型,裁判能力可能成为整个系统的上限;J-Zero 则让裁判跟随当前的自我进化前沿共同调整。
  • 利用“来源已知”的偏好对。 裁判训练所需的偏好顺序并非来自它自己的打分,而是由生成过程预先确定。例如,Solver 的回答被置于 Challenger 的回答之上;经过拆解和重组的回答被置于一次性回答之上。这样可以在缺少人工标签的情况下,构造相对明确的比较信号。
  • 覆盖可验证与不可验证领域。 论文摘要称,J-Zero 相比基线在可验证领域平均提升 4.2 分,在不可验证领域平均提升 8.0 分,并至少持续改进十轮;基线则在两轮后出现退化。

意义与限制

J-Zero 的启发不只是“让模型互相出题”,而是把出题、作答和评价视为一个需要共同设计的系统。对于不可验证任务,预先知道的生成来源可以提供弱监督,降低对大量人工偏好数据的依赖;而裁判的动态适应,则有望减少固定评估器对能力上限的约束。

不过,这种偏好关系主要反映生成流程,而不等同于所有场景下的真实质量排序。挑战者、解题者和裁判若共享相似缺陷,也可能形成封闭循环。因此,J-Zero 更适合被理解为一种自我改进框架,而不是无需外部校验的自动可靠性保证。后续仍需关注跨模型、跨任务以及更严格人工评估下的稳定性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
没有标准答案,模型也能在测试时自我优化:TTPO如何利用共识与分歧
强化学习
cctest.ai
强化学习

没有标准答案,模型也能在测试时自我优化:TTPO如何利用共识与分歧

TTPO提出一种无需人工标签的测试时训练方法:把多数投票结果当作弱监督信号,同时区别对待认同与不认同该结果的推理轨迹。研究显示,这种非对称优化能够降低伪标签错误带来的风险。

阅读全文