返回文章列表
强化学习

HuatuoGPT-3:不依赖 SFT 的医疗大模型强化学习适配

阅读约 2 分钟

导语

把通用大语言模型变成医疗专家,通常需要先进行监督微调(SFT),再借助强化学习优化回答质量。这条路径容易启动,却也带来多阶段训练、探索空间收窄等问题。HuatuoGPT-3 试图换一条路线:从基础模型出发,仅通过强化学习完成领域适配,并以 One-stage Policy Optimization(OnePO)作为核心方法。

核心要点

  • 目标是 RL-only 适配。 论文认为,SFT 能提供冷启动,但模型可能过早模仿示范数据,降低后续探索多样性;纯在线强化学习则可能因为缺少有效起点而难以学习。
  • 识别两类训练瓶颈。 在混合策略强化学习中,教师输出里的关键信息可能处于当前策略的低概率区域,导致早期梯度信号不足,论文将其称为“梯度饥饿”(Gradient Starvation)。另一方面,如果持续依赖旧的教师输出,策略会被过时的教师分布牵制,形成“教师分布锚定”(Teacher-Distribution Anchoring)。
  • 教师只提供临时指导。 OnePO 通过“自适应目标演化”强化对低概率但有信息量的教师 token 的学习,同时引入“教师退役”机制:当当前策略已经能够超过教师输出时,就逐步放弃这些旧示范,而不是长期进行模仿。
  • 小规模数据实验显示优势。 根据摘要,在医疗适配实验中,OnePO 使用 2 万条训练样本取得 HealthBench(Total)67.2 分,较 SFT+RL 和纯 RL 分别高 2.7 分和 7.4 分。
  • 进一步扩展为模型系列。 HuatuoGPT-3 被定位为开源医疗大模型系列。论文摘要称,27B 版本在 HealthBench(Total)上达到 70.1 分,在 HealthBench Professional 上达到 71.4 分,并报告其超过包括 GPT-6 Astra 在内的前沿模型。

意义与边界

HuatuoGPT-3 的价值不只是发布一个医疗模型,更在于把领域适配的重点从“准备多少监督数据”推进到“如何让强化学习自行发现领域能力”。如果教师信号能够被动态使用而非永久依赖,模型就有机会兼顾冷启动效率与后期探索能力。这一思路也可能为法律、金融和代码等高专业度领域提供参考。

不过,论文摘要披露的结果主要集中在特定医疗基准和训练设置上,不能直接等同于真实临床可靠性。医疗模型仍需面对事实准确性、风险控制、专业责任和部署合规等问题。OnePO 是否能在更多模型规模、任务类型和领域中稳定复现,也有待完整论文与后续开源实验进一步验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
LoGRA:用低秩梯度草图降低大模型强化学习的显存门槛
强化学习
cctest.ai
强化学习

LoGRA:用低秩梯度草图降低大模型强化学习的显存门槛

LoGRA 将大模型强化学习中的梯度信号压缩为低秩表示,同时配合预测 KL 的步长控制,在尽量保持效果的前提下降低训练内存。论文报告称,该方法最高可减少 45.7% 的平均训练内存,并支持在单个八卡节点上稳定训练 27B 模型。

阅读全文
CCTest · Blog
VLA强化学习的关键变化,可能集中在一个被忽视的小模块
强化学习
cctest.ai
强化学习

VLA强化学习的关键变化,可能集中在一个被忽视的小模块

一项针对多种流式VLA模型的研究发现,强化学习产生的参数更新呈现明显低秩特征,并高度集中于动作专家中的Timestep Modules。研究进一步指出,这些模块中的shift向量不仅与任务成功密切相关,还能反映任务之间的迁移关系。

阅读全文