外部監督なしのオンポリシー自己蒸留:モデル自身の合意から学ぶ U-OPSD
本論文は、モデル自身の複数生成結果から擬似解を作り、それとの不一致を学習信号にする U-OPSD を提案する。真値ラベルや強い教師モデルを使わずに、数学推論ベンチマークで基盤モデルを安定して上回った点が特徴だ。
続きを読む本論文は、モデル自身の複数生成結果から擬似解を作り、それとの不一致を学習信号にする U-OPSD を提案する。真値ラベルや強い教師モデルを使わずに、数学推論ベンチマークで基盤モデルを安定して上回った点が特徴だ。
続きを読むSPOT は、On-Policy Distillation において、どの位置を詳しく調べ、どの候補を学習目標にすべきかを同時に扱う手法です。教師モデルの局所確率だけでなく、検証器が評価した後続結果を使って蒸留ターゲットを調整します。
続きを読むこの技術レポートは、言語モデルの解釈可能性を学習後に付け足すのではなく、学習プロセスそのものに組み込むべきだと主張している。Steerling-8B は生成結果を入力、概念、学習データへ結び付ける試みとして紹介されている。
続きを読むSkaling law は、モデル容量と学習データの相互作用を単一の指数で表し、従来のニューラルスケーリング則が極端な条件で外しやすい問題を補正しようとする研究です。
続きを読むByteDanceが最大10兆パラメータ規模のAIモデルを訓練していると報じられた。中国勢が米トップ研究所に近づくだけでなく、最前線で競う段階に入っていることを示す動きだ。
続きを読むGradCuit は、Transformer の中間層に最適化可能な連続状態を挿入し、生成結果からの勾配を内部推論へ直接戻す手法です。モデル重みを更新せずに、推論精度と頑健性を高めることを狙います。
続きを読むWeak-to-Strong On-Policy Distillation は、より強い教師モデルを前提にしない LLM 蒸留手法です。小さなモデル同士の logit 差分から能力方向を取り出し、強い学生モデルの改善に使います。
続きを読むMulti-Head Attention Residuals(MHAR)は、Transformer が深さ方向の履歴を読む方法を見直す手法です。全特徴幅で 1 つのルーティング分布を共有するのではなく、特徴サブスペースごとに別々の softmax を持たせます。
続きを読む本論文は、オフポリシー生成をそのまま模倣するのではなく、各トークンが正しいかどうかを学習するTOPLを提案する。要約と翻訳の両方で、分布ずれに対する頑健性が示された。
続きを読むHugging Face Daily Papers に掲載された論文は、MoE 構成のループ型 Transformer「Loopie」を紹介している。著者らは、同じ事前学習計算量の下で通常の Transformer ベースラインを上回り、後処理学習によって強い推論能力を得たと主張する。
続きを読むDeepLoop は、同じ Transformer ブロックを繰り返し使うと残差スケーリングの前提が変わる点に注目した研究です。名目上の層数だけでなく、パラメータが何度訪問されるかを考慮した設計を提案しています。
続きを読むGigaWorld-Policy-0.5 は、推論時に未来動画を生成する World Action Models の重さに焦点を当てている。訓練では未来の視覚変化を活用し、実行時には行動のみを出力する設計が特徴だ。
続きを読むarXivに投稿された論文は、LLMの誤った推論ステップをユーザーが元の回答上で直接編集し、その修正済みCoTを蒸留プロンプトとして再利用する Deep Interaction を提案している。
続きを読むarXiv の新論文は、Transformer のフィードフォワードブロックを、深さ方向にどれだけ勾配のランクを保てるかという観点から再解釈している。残差接続、正規化の位置、幅の拡張は、単なるスケール制御ではなくランク崩壊を避ける仕組みとして整理される。
続きを読むDeltaMerge-LowRes は、低リソース言語で新しいタスクに対応する際の高コストな共同微調整を避けるための手法だ。言語 delta とタスク delta を別々に学習し、推論時に合成する。
続きを読む