HuatuoGPT-3:SFTを使わず強化学習だけで医療LLMを適応
導入
汎用の大規模言語モデルを医療分野の専門モデルへ変える場合、一般的にはまず教師ありファインチューニング(SFT)を行い、その後に強化学習(RL)で応答品質を調整する。このSFT+RL方式は初期状態を作りやすい一方、最適化が複数段階に分かれ、モデルが早い段階から教師データを模倣しすぎることで探索の幅を狭める可能性がある。HuatuoGPT-3は、基盤モデルからSFTを経ず、RLだけで医療分野に適応する方法を検討している。
中心となる手法がOne-stage Policy Optimization、略してOnePOである。OnePOでは、教師が生成した回答を固定的な正解として扱わず、方策を改善するための一時的な手がかりとして利用する。
主なポイント
- SFT+RLへの代替案。 SFTはコールドスタートを容易にするが、初期から示例への模倣を強める可能性がある。反対に、純粋なオンポリシーRLは有効な行動をまだ持たないため、学習開始時に難しさが生じる。
- 二つの失敗要因。 混合方策RLでは、教師回答に含まれる重要なトークンが現在の方策から見て低確率になることがある。その結果、初期の学習信号が弱くなる現象を論文は「Gradient Starvation」と呼ぶ。また、古い教師回答を学習し続けると、方策が過去の教師分布に縛られる「Teacher-Distribution Anchoring」が起こり得る。
- 目的の適応と教師の退役。 OnePOはAdaptive Objective Evolutionによって、情報量がある低確率トークンをより強く学習する。さらに、現在の方策が教師回答を上回れるようになれば、その回答を訓練から外すTeacher Retirementを導入する。
- 限られたデータでの結果。 論文要約によれば、医療適応実験では2万件の学習サンプルを使い、HealthBench Totalで67.2点を得た。これはSFT+RLを2.7点、純粋なRLを7.4点上回ると報告されている。
- モデル系列への拡張。 HuatuoGPT-3はオープンソースの医療LLM系列として展開された。要約では、27B版がHealthBench Totalで70.1点、HealthBench Professionalで71.4点に達し、GPT-6 Astraを含むフロンティアモデルを上回ったとしている。
意義と留意点
HuatuoGPT-3の重要性は、単に医療モデルを追加したことだけではない。専門化に必要な教師データを長期間模倣させるのではなく、教師の振る舞いを初期の足場として使い、方策が改善した後はそこから離れるという、領域適応の考え方を示している。法律、金融、コード生成など、専門知識と探索の両方が必要な領域にも応用の余地がある。
ただし、報告された数値は特定の医療ベンチマークと訓練条件に基づく。ベンチマーク性能だけから、実際の診断や治療における安全性・信頼性を結論づけることはできない。異なるモデル規模、報酬設計、分野でOnePOが安定して再現できるかは、完全な論文と今後の公開実験による検証が必要である。
コメント
ログイン状態を確認中…
コメントを読み込み中…