J-Zero:让挑战者、解题者与裁判协同进化
阅读约 2 分钟
导语
让语言模型自己提出问题、解决问题,再判断答案优劣,是减少人工监督依赖的一条重要路线。过去,这类自我进化方法在数学、代码等“有标准答案”的任务上更容易落地;一旦进入写作、开放问答等不可验证领域,模型如何获得可靠反馈便成为瓶颈。KAIST AI 团队提出的 J-Zero,试图用三个相互适应的角色,建立一套覆盖两类任务的闭环。
核心要点
- 挑战者负责抬高难度。 Challenger 生成任务,并在与 Solver 的交互中不断制造更具挑战性的输入。Solver 则针对这些任务学习生成质量更高的回答。二者形成类似攻防的关系:挑战者推动能力边界,解题者负责追赶。
- 裁判不再完全固定。 J-Zero 的关键变化是让 Judge 也参与进化。传统方案往往使用冻结的评估模型,裁判能力可能成为整个系统的上限;J-Zero 则让裁判跟随当前的自我进化前沿共同调整。
- 利用“来源已知”的偏好对。 裁判训练所需的偏好顺序并非来自它自己的打分,而是由生成过程预先确定。例如,Solver 的回答被置于 Challenger 的回答之上;经过拆解和重组的回答被置于一次性回答之上。这样可以在缺少人工标签的情况下,构造相对明确的比较信号。
- 覆盖可验证与不可验证领域。 论文摘要称,J-Zero 相比基线在可验证领域平均提升 4.2 分,在不可验证领域平均提升 8.0 分,并至少持续改进十轮;基线则在两轮后出现退化。
意义与限制
J-Zero 的启发不只是“让模型互相出题”,而是把出题、作答和评价视为一个需要共同设计的系统。对于不可验证任务,预先知道的生成来源可以提供弱监督,降低对大量人工偏好数据的依赖;而裁判的动态适应,则有望减少固定评估器对能力上限的约束。
不过,这种偏好关系主要反映生成流程,而不等同于所有场景下的真实质量排序。挑战者、解题者和裁判若共享相似缺陷,也可能形成封闭循环。因此,J-Zero 更适合被理解为一种自我改进框架,而不是无需外部校验的自动可靠性保证。后续仍需关注跨模型、跨任务以及更严格人工评估下的稳定性。
评论
正在确认登录状态……
正在加载评论……