記事一覧へ戻る
推論・デプロイ

TPUがKimiを57%高速化、差を生んだのは推論ソフトウェア

読了目安 3 分

導入

大規模モデルの推論でGoogle TPUがNvidia GPUに対抗できるかどうかは、ピーク演算性能だけでは決まりません。Inferactが公開したテストでは、16基のTPU v7 IronwoodでKimi K3を実行した場合、毎秒709トークンに達しました。一方、16基のGB200は452トークンで、TPUが57%上回ったとされています。重要なのは、チップ単体よりも、その上で動くソフトウェア設計です。

テストの要点

  • 両システムは同じKimi K3とvLLM推論エンジンを使用し、主な違いはアクセラレーターと低レベルKernelでした。
  • TPU側ではDSpark推測デコードを利用しました。小さなモデルが候補トークンを生成し、大きなモデルがまとめて検証する方式で、平均受理長は6と報告されています。
  • 推測デコードを無効にしたBatch Size 1では、TPUが毎秒249トークン、GB200が127トークンでした。Batch Size 8では865と636でした。
  • Qwen 3.8 27Bでは、4基のTPUが毎秒1515トークン、4基のGB200が695トークンでした。
  • Inferactによれば、TPU上のKimi K3はGPQA-Diamondで94.4%、GSM8Kで97.2%となり、GPU側と同じ結果でした。

これらはInferactが提示したベンチマークです。実装の可能性を示す一方、すべてのモデルや運用条件での優位性を証明するものではありません。

Megakernelの狙い

自己回帰推論では、演算そのものよりデータ移動がボトルネックになることがあります。従来方式では処理を多数の小さなKernelに分割するため、Kernel間の起動や受け渡しでメモリ帯域が遊びます。InferactのMegakernelは、Kimi K3の複数層の処理を一つのPallasプログラムにまとめました。

これにより、ある層を計算している間に次の層の重みを先読みできます。TPUのVMEMはソフトウェアで明示的に管理できるため、何を読み込み、保持し、解放するかを細かく制御できます。InferactはXLAに任せるのではなく、モデル全体のデータ移動を手作業で構成したと説明しています。コンパイル時間は30分超から90秒未満に短縮されたとされます。

意義と限界

この結果は、推論競争の焦点がピーク演算性能からデータフローとメモリ利用効率へ移っていることを示します。TPUにとっては、オープンソース推論基盤への対応拡大が新しいハードウェアと同じくらい重要になる可能性があります。

一方、現在のMegakernelはKimi K3向けに調整されています。別のモデル構造へ展開するには再適応が必要です。今後、より多くのモデルを支援し、vLLMに統合され、実際の遅延・コスト・同時実行条件でも優位性を維持できるかが評価の焦点になります。

出典:量子位

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SSDを「メモリ階層」に使うColibrì、巨大MoEモデルを一般PCで推論
推論・デプロイ
cctest.ai
推論・デプロイ

SSDを「メモリ階層」に使うColibrì、巨大MoEモデルを一般PCで推論

オープンソースのColibrìは、MoEモデルの専門家重みをNVMe SSDに置き、必要なものだけをRAMやVRAMへ読み込む推論フレームワークです。必要メモリは下げられますが、SSDの速度が推論性能を大きく左右します。

続きを読む
CCTest · Blog
Flash-dLLM、I/Oを意識したKVキャッシュで拡散型LLMを高速化
推論・デプロイ
cctest.ai
推論・デプロイ

Flash-dLLM、I/Oを意識したKVキャッシュで拡散型LLMを高速化

Flash-dLLMは、拡散型大規模言語モデルの推論で問題となるKVキャッシュのメモリーI/Oを抑え、並列デコードを効率化する学習不要のフレームワークです。補助的なドラフトモデルを使わず、モデル自身による生成と検証を組み合わせます。

続きを読む
CCTest · Blog
vLLMがハードウェア非依存レイヤーを導入、性能と移植性を両立へ
推論・デプロイ
cctest.ai
推論・デプロイ

vLLMがハードウェア非依存レイヤーを導入、性能と移植性を両立へ

vLLMは最新ハードウェアでの最高性能を狙うフラットモデルを拡大する一方、旧世代GPUや外部アクセラレーター向けにハードウェア非依存レイヤーを導入します。H100では、3モデルの幾何平均で総トークンスループットがネイティブ実装から3.4%以内でした。

続きを読む