記事一覧へ戻る
強化学習

Rufus-Air、大規模言語モデルの後学習を再現可能な工程に

読了目安 3 分

導入

大規模言語モデルの改善競争は、事前学習の規模だけでなく、基盤モデルを実用的なシステムへ変える後学習へと移っている。Rufus-Airの特徴は、後学習を個別の工夫の集合ではなく、公開された一連の工程として整理した点にある。GLM-4.5-Air-Base(106B-A12B)を基盤に、推論、コーディング、指示追従、エージェント能力をどのように段階的に高めるかを示している。

能力を広げる8段階

Rufus-Airは次のシリアルなパイプラインを採用する。

  • SFT:多様で高品質なデータにより、基本能力の土台を作る。
  • Reasoning RL:推論能力を強化する。
  • Coding RL:コード課題を対象に強化学習を行う。
  • Instruction-Following RL:ユーザー指示への追従性を高める。
  • General Agent:汎用エージェント課題へ拡張する。
  • Coding Agent:コードエージェントの能力を磨く。
  • Search Agent:検索を伴うエージェント行動を学習する。
  • RLHF:最後に嗜好を重視した強化学習を加える。

重要なのは、単に段階が多いことではなく、その順序である。結果が明確で検証しやすい課題を先に扱い、より複雑で総合的な判断を要する課題を後に置く。報酬も、比較的堅牢なハードな信号から、審判モデルに依存するソフトな信号へと移行する。これにより、曖昧な最適化目標が早期学習を不安定にするリスクを抑える考え方だ。

論文が示す4つのポイント

第一に、SFTは単なる準備工程ではない。多様で高品質な教師データが、後続のRLが伸ばせる能力の下限を決める。

第二に、RL用プロンプトの難易度を制御する必要がある。簡単すぎる課題は学習信号が弱く、難しすぎる課題は効率的な最適化を妨げる。挑戦的でありながら学習可能な範囲へ絞り込むことが実務的な手法になる。

第三に、報酬の信頼性は工程順序を決める原則になる。実行可能なテストや明確な正解は前半に適し、審判モデルによる評価は基本能力が形成された後に導入する方がよい。

第四に、インフラもレシピの一部である。データ処理、訓練基盤、評価、段階間の接続が結果を左右するため、アルゴリズム名だけでは再現性を説明できない。

意義と影響

Rufus-Airは、オープンモデルの後学習には強い基盤モデルだけでなく、データ管理、報酬設計、工程運用を安定した仕組みにまとめることが必要だと示す。著者らは、公式のGLM-4.5-Air後学習版を上回り、同規模のオープンモデルと競争力があると報告している。また、オープンソースの部品と公開データを中心に使い、新たな人手アノテーションや社内蒸留教師には依存していない。

研究者にとっては、各段階の効果を個別に分析できる実験枠組みになる。開発者にとっての教訓は、後学習は単にRLを追加する作業ではなく、能力の土台、報酬の信頼性、課題の複雑さを管理するシステム工程だということだ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
BPO、批評器なしで検証可能報酬によるLLM学習を再構成
強化学習
cctest.ai
強化学習

BPO、批評器なしで検証可能報酬によるLLM学習を再構成

Bellman Policy Optimization(BPO)は、終端報酬を使う自己回帰生成向けの批評器なし方策最適化手法です。方策ミラー降下を軌跡レベルの目的へ変換し、相補的なトークン確率の平滑化比で方策の不一致を補正します。

続きを読む