記事一覧へ戻る
推論・デプロイ

4ビットモデルがBF16版を上回る理由、QAHの仕組み

読了目安 3 分

概要

モデルを効率化する一般的な手順は、まず層やアテンションヘッド、ニューロンを削減し、その後に残った重みを4ビットへ量子化する方法です。メモリと計算量は減りますが、推論、数学、コード生成などの能力が落ちることがあります。Hugging Face Blogで紹介されたQuantization-Aware Healing(QAH)は、この圧縮後の回復方法を見直します。

QAHの要点

  • 教師を圧縮前に戻す:従来の量子化対応蒸留では、圧縮後に回復したBF16モデルを教師にすることがあります。QAHは、圧縮前のフルサイズかつフル精度のモデルを直接教師として使います。教師と生徒の構造が異なっていても、出力ロジットの分布を合わせるため知識を移せます。
  • 量子化を新たな蒸留機会にする:量子化を単なる最後の変換とみなさず、前段の圧縮・回復で移しきれなかった情報を、もう一度元の教師から学ぶ工程として扱います。
  • 長文でもメモリを抑える:系列全体と語彙の巨大なテンソルを一度に作らず、KLダイバージェンスを分割計算します。これにより、最大32kトークンの文書を一定のGPUメモリ内で扱えると説明されています。

実験結果の読み方

研究チームはGPT-OSS 120Bを60Bへ圧縮し、BF16の回復版を作った後、QAHで60BのMXFP4モデルを生成しました。同じ60B構成のBF16版と比較すると、9ベンチマーク中7つでQAH版が上回りました。改善が目立ったのは圧縮の影響を受けやすい領域で、AA-LCRの長文推論は7.4ポイント、AIME 2025の数学は5.6ポイント上昇しました。エージェント型コーディング、ツール利用、科学問題、指示追従、LiveCodeBenchでも改善しています。

一方、MMLU-Proは0.2ポイント、SciCodeは1.4ポイント下がりました。60BのQAH版はLiveCodeBenchで66.5点となり、120B教師の66.0点をわずかに上回りました。しかし、GPQA Diamondでは67.4点で教師の69.0点に届かず、特に難しい長文推論ではモデル容量による差が残っています。

意義と限界

QAHの重要性は、回復対象を「すでに情報を失った中間チェックポイント」に固定しない点にあります。小さいモデルは4ビットで動作しながら、元の大規模モデルの出力分布へ直接近づけます。メモリ制約のある推論環境や、運用コストを重視するサービスにとって有用な考え方です。

ただし、結果は特定のGPT-OSS構成、MXFP4形式、限られた評価指標に基づきます。学習コストや必要データ、他のモデル構造での再現性は、この素材だけでは判断できません。QAHは有望な圧縮後回復手法ですが、4ビットモデルが一般にBF16版を超えると結論づける段階ではありません。

出典:Hugging Face Blog

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
TileMix、ハードウェアタイル単位でLLM注意機構の精度を切り替え
推論・デプロイ
cctest.ai
推論・デプロイ

TileMix、ハードウェアタイル単位でLLM注意機構の精度を切り替え

TileMixは、融合された密な注意機構カーネルの中で、スコアタイルごとにFP16とINT8を使い分けます。トークン間の接続を削らず、長文脈プリフィルの精度とスループットの両立を目指します。

続きを読む
CCTest · Blog
Daedalus-150M、CPU推論を起点に設計した畳み込み・注意融合モデル
推論・デプロイ
cctest.ai
推論・デプロイ

Daedalus-150M、CPU推論を起点に設計した畳み込み・注意融合モデル

Daedalus-150M は、大規模モデルを縮小してから CPU に載せるのではなく、4bit重み・単一ユーザー・逐次デコードという運用条件から逆算して設計された小型言語モデルです。18ブロックのうち12ブロックを短い畳み込みに置き換え、長いコンテキストでの KV キャッシュ読み出しを抑えます。

続きを読む
CCTest · Blog
ParaTempo、時間的信頼度で並列推論を動的に最適化
推論・デプロイ
cctest.ai
推論・デプロイ

ParaTempo、時間的信頼度で並列推論を動的に最適化

ParaTempo は、各推論ブランチが時間とともにどれだけ答えの候補へ収束するかを測る、学習不要の非同期並列推論フレームワークです。信頼度に応じて枝刈りや早期終了、新しいブランチへの計算資源の再配分を行います。

続きを読む