記事一覧へ戻る
推論・デプロイ

RAZOR、専門家の代替可能性でMoEを剪定

読了目安 3 分

導入

Mixture-of-experts(MoE)モデルは、トークンごとに少数の専門家だけを有効化することで計算量を抑えます。しかし推論時には、通常、専門家プール全体を保存しておく必要があります。モデルが大規模になるほど、保存容量を減らすための専門家剪定が重要になります。課題は、能力をできるだけ維持しながら、どの専門家を削除するかです。

arXivで発表されたRAZORは、この判断を専門家の利用頻度ではなく「機能的な代替可能性」に基づいて行います。

機能の代替可能性を測る

利用回数、ルーティング重み、出力の大きさは手掛かりになりますが、削除時の損失を直接示すとは限りません。頻繁に選ばれる専門家でも、他の専門家が同じ機能を補える場合があります。逆に、利用頻度が低い専門家が独自の役割を担う可能性もあります。

RAZORは「コンセンサス残差」を導入します。これは、ある専門家の出力が、元の重み付き混合出力からどの程度ずれているかを表す指標です。他の専門家が形成する計算からのずれを見ることで、その機能がどれほど固有かを評価します。

論文では、層への入力を固定した場合に、専門家を1つ削除したときの変化を表す厳密な恒等式も導出しています。そこでは、残存専門家の重みの再正規化だけでなく、削除後にルーターが選ぶ補充専門家も扱います。RAZORは校正用トークンから局所的な信号を集約し、指定した削減予算に応じて専門家を順位付けします。勾配や削除後の回復学習は必要ありません。

実験結果

評価対象はGLM-4.7-Flash、Qwen3.6-35B-A3B、DeepSeek-V4-Flash-0731、Hy3の4モデルです。専門家を25%または50%削除した8つのモデル・予算設定すべてで、RAZORは比較対象の中で最高の9タスク平均を達成したと報告されています。

REAPと条件をそろえた2つのバックボーンでは、RAZORが2.12~5.59ポイント上回り、36件のペア比較すべてで勝利しました。また、GLM-4.7-FlashとQwen3.6-35B-A3Bの4つの対応設定では、REAPより逆KLも低くなりました。

意義と限界

RAZORの重要な点は、MoE剪定の問いを「重要な専門家はどれか」から「残りの専門家がその機能を覆えるか」へ移したことです。追加学習なしで実行できるため、保存容量を抑えたい推論環境で使いやすい可能性があります。

ただし、ベンチマークの性能や予測分布が維持されても、生成挙動が完全に同じになるわけではありません。Qwen3.6-35B-A3Bの応答分析では、剪定後に多様性、書式、終了の仕方に変化が見られました。今後はタスクスコアや分布指標だけでなく、長文生成、構造化出力、停止挙動も確認する必要があります。

出典:arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Mentored Decoding:推測デコーディングとブースティングをつなぐ
推論・デプロイ
cctest.ai
推論・デプロイ

Mentored Decoding:推測デコーディングとブースティングをつなぐ

新しいarXiv論文は、損失を許容する推測デコーディングを形式化し、ターゲットモデルとの分布差を適切に管理すれば、速度向上だけでなく品質改善も起こり得る理由を分析した。解析にはブースティングとfダイバージェンスが用いられている。

続きを読む
CCTest · Blog
HybridInfer、スマホの熱余裕を使ってLLMの実行先を選択
推論・デプロイ
cctest.ai
推論・デプロイ

HybridInfer、スマホの熱余裕を使ってLLMの実行先を選択

HybridInferは、実際のAndroid端末で端末内・エッジ・クラウドのLLMを動的に振り分ける強化学習ルーターです。モバイル推論の問題は単なる速度低下ではなく、連続生成による実行環境の不安定化にも及ぶと指摘します。

続きを読む
CCTest · Blog
SSDを「メモリ階層」に使うColibrì、巨大MoEモデルを一般PCで推論
推論・デプロイ
cctest.ai
推論・デプロイ

SSDを「メモリ階層」に使うColibrì、巨大MoEモデルを一般PCで推論

オープンソースのColibrìは、MoEモデルの専門家重みをNVMe SSDに置き、必要なものだけをRAMやVRAMへ読み込む推論フレームワークです。必要メモリは下げられますが、SSDの速度が推論性能を大きく左右します。

続きを読む