記事一覧へ戻る
推論・デプロイ

UniMoMo:推薦 MoE を専門家マージで軽量化する手法

読了目安 3 分

導入

疎な mixture-of-experts(MoE)は、推薦モデルの容量を拡張する有力な方法です。入力ごとに一部の専門家だけを使うため、計算量を抑えながら多様なユーザー行動やアイテム文脈を表現できます。しかし、学習済み checkpoint には依然として全専門家が保存され、ルータも元の専門家集合を対象に動作します。大規模な推薦サービスでは、これはメモリ、遅延、運用コストの問題になります。

UniMoMo が扱うのは、この現実的なデプロイ課題です。すでに学習した推薦 MoE を、指定された専門家数の範囲内で、追加のオンライン圧縮モジュールなしに小さな標準 MoE へ変換します。

核心ポイント

  • パラメータではなく機能で比べる:重みの距離が近い専門家が、必ずしも同じように振る舞うとは限りません。UniMoMo は無ラベル校正データを使い、共通の推薦状態に対する各専門家の出力を比較して、機能的に近い専門家を見つけます。

  • 制約付きグラフ粗化として定式化:専門家統合を、専門家数の予算を持つグラフ粗化問題として扱います。単純な削除や平均化ではなく、どの専門家を同じグループにまとめるかを体系的に決める設計です。

  • 高トラフィック専門家を保護:MoE では専門家の利用頻度が均一ではありません。多くルーティングされる専門家は重要な経路を担っている可能性があります。UniMoMo は層ごとに適応する保護機構を導入し、ルーティング露出の高い専門家の無理な統合を制限します。

  • 推論時の構造は標準 MoE のまま:圧縮後のモデルは通常の top-k MoE として動作します。特別な推論モジュールを必要としないため、既存の serving パイプラインに組み込みやすい点が実用上の強みです。

  • 校正を使った再構成:SwiGLU 専門家の統合後には、最小二乗による補正で元モデルの中間活性をよりよく再現し、統合による表現のずれを抑えます。

結果と意義

Amazon Beauty、KuaiRec、TenRec の各データセット、および 2、4、6 個の MoE block を持つ設定で、4 専門家 checkpoint は元モデルに対する 5 回平均 NDCG@10 比率が 99.92%〜102.30% となりました。A100 上の実測高速化は 1.28 倍〜1.63 倍です。さらに積極的な 2 専門家・top-1 設定では、NDCG@10 比率が 98.36%〜104.24%、高速化が 1.47 倍〜2.21 倍と報告されています。

この結果は、推薦 MoE の専門家群に機能的な冗長性が存在し得ることを示しています。UniMoMo の重要性は、それを単なる圧縮率の話にせず、複数の serving 予算に合わせて標準 MoE checkpoint をエクスポートできる実務フローに落とし込んだ点にあります。

一方で、校正データが本番分布をどれだけ反映するかは重要です。トラフィックが大きく変化すれば、保護すべき専門家も変わる可能性があります。それでも、品質、ルーティング、推論単純性を同時に扱う UniMoMo は、推薦 MoE の運用負荷を下げる有望な方向と言えます。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
vLLM の DCP、長文脈推論における KV キャッシュの壁を崩す
推論・デプロイ
cctest.ai
推論・デプロイ

vLLM の DCP、長文脈推論における KV キャッシュの壁を崩す

vLLM の Decode Context Parallelism(DCP)は、KV キャッシュを注意ヘッドではなくシーケンス方向に分割する。長文脈エージェント負荷で顕在化する GPU メモリ不足を緩和し、高並行時のスループット改善を狙う仕組みだ。

続きを読む
CCTest · Blog
GPTQ-2D:双方向の適応的丸めを4次時間から3次時間へ
推論・デプロイ
cctest.ai
推論・デプロイ

GPTQ-2D:双方向の適応的丸めを4次時間から3次時間へ

GPTQ-2D は、残差の左側と右側の両方に基底行列が作用する、より一般的な適応的丸め問題を扱う。行列を単純にベクトル化する方法と同じ丸め結果を保ちながら、反対角線ごとの処理で計算量を3次時間に下げる。

続きを読む
CCTest · Blog
OmniScope:音声と映像の重要度を分けて圧縮する OmniLLM 推論手法
推論・デプロイ
cctest.ai
推論・デプロイ

OmniScope:音声と映像の重要度を分けて圧縮する OmniLLM 推論手法

OmniScope は、音声と映像の関連度が同じタイミングで高まるとは限らない点に着目した、学習不要の Token 圧縮フレームワークです。クエリを共通の意味アンカーにしつつ、各モダリティの重要度を別々に推定します。

続きを読む