HuatuoGPT-3:不依赖 SFT 的医疗大模型强化学习适配
阅读约 2 分钟
导语
把通用大语言模型变成医疗专家,通常需要先进行监督微调(SFT),再借助强化学习优化回答质量。这条路径容易启动,却也带来多阶段训练、探索空间收窄等问题。HuatuoGPT-3 试图换一条路线:从基础模型出发,仅通过强化学习完成领域适配,并以 One-stage Policy Optimization(OnePO)作为核心方法。
核心要点
- 目标是 RL-only 适配。 论文认为,SFT 能提供冷启动,但模型可能过早模仿示范数据,降低后续探索多样性;纯在线强化学习则可能因为缺少有效起点而难以学习。
- 识别两类训练瓶颈。 在混合策略强化学习中,教师输出里的关键信息可能处于当前策略的低概率区域,导致早期梯度信号不足,论文将其称为“梯度饥饿”(Gradient Starvation)。另一方面,如果持续依赖旧的教师输出,策略会被过时的教师分布牵制,形成“教师分布锚定”(Teacher-Distribution Anchoring)。
- 教师只提供临时指导。 OnePO 通过“自适应目标演化”强化对低概率但有信息量的教师 token 的学习,同时引入“教师退役”机制:当当前策略已经能够超过教师输出时,就逐步放弃这些旧示范,而不是长期进行模仿。
- 小规模数据实验显示优势。 根据摘要,在医疗适配实验中,OnePO 使用 2 万条训练样本取得 HealthBench(Total)67.2 分,较 SFT+RL 和纯 RL 分别高 2.7 分和 7.4 分。
- 进一步扩展为模型系列。 HuatuoGPT-3 被定位为开源医疗大模型系列。论文摘要称,27B 版本在 HealthBench(Total)上达到 70.1 分,在 HealthBench Professional 上达到 71.4 分,并报告其超过包括 GPT-6 Astra 在内的前沿模型。
意义与边界
HuatuoGPT-3 的价值不只是发布一个医疗模型,更在于把领域适配的重点从“准备多少监督数据”推进到“如何让强化学习自行发现领域能力”。如果教师信号能够被动态使用而非永久依赖,模型就有机会兼顾冷启动效率与后期探索能力。这一思路也可能为法律、金融和代码等高专业度领域提供参考。
不过,论文摘要披露的结果主要集中在特定医疗基准和训练设置上,不能直接等同于真实临床可靠性。医疗模型仍需面对事实准确性、风险控制、专业责任和部署合规等问题。OnePO 是否能在更多模型规模、任务类型和领域中稳定复现,也有待完整论文与后续开源实验进一步验证。
评论
正在确认登录状态……
正在加载评论……