記事一覧へ戻る
推論・デプロイ

FreeToken、個人PCを大規模MoE推論の弾性基盤に

読了目安 3 分

導入

オープンウェイトモデルの性能は急速に高まっていますが、その提供方法は依然としてデータセンターのGPUを前提にしがちです。個人向けPCでは、GPUメモリの容量だけでなく、システムメモリの帯域、CPUとGPUのデータ転送、さらにエージェントが蓄積する状態がボトルネックになります。FreeTokenは、個人PCを性能の低いGPUとして扱うのではなく、複数の資源を実行時に組み合わせる弾性的な推論プラットフォームとして捉えます。

主なポイント

  • MoEに合わせて提供スタックを再設計。 モデルの配置とロード、エキスパートの常駐、CPU-GPU間の実行、エージェント状態の再利用、実行時のメモリ管理をまとめて設計しています。
  • 帯域に応じた動的な配置。 PCごとにGPUメモリ、システムメモリ、CPU性能、転送帯域のバランスは異なります。FreeTokenはCPUとGPUの役割を固定せず、利用可能な資源へ計算とモデル状態を継続的に割り当てます。
  • 変化するエージェント処理に対応。 コーディングエージェントやツール利用エージェントでは、セッション中に実行パターンが変わります。FreeTokenは、エキスパートへのアクセスや状態の変化を実行時の課題として扱い、状態の再利用を組み込みます。
  • ローカルで扱える範囲を拡大。 20以上のMoEモデルを、8GB GPUのノートPCから単一ワークステーションGPUまででサポートします。論文が挙げる例は、ノートPCで35B、ゲーミングPCで284B、単一ワークステーションGPUで753BのGLM-5.2です。

意義と影響

FreeTokenの焦点は、単に大きなモデルを小さな機器へ押し込むことではありません。GPUメモリに全パラメータを置けない場合、どのエキスパートを常駐させ、どの状態を再利用し、CPUや別のメモリ資源をいつ使うかが重要になります。MoEではトークンごとに一部のエキスパートだけが選ばれますが、エキスパートの重みを移動するコストは応答性を左右します。そのため、固定的な分割よりも、実行時の配置変更に意味があります。

この考え方は、オープンウェイトを「ダウンロードできるモデル」から「ローカルで運用できるソフトウェア」へ近づける可能性があります。一方、提供された素材には、各ハードウェアを同一条件で比較したスループット、初回トークン遅延、生成速度、消費電力の数値はありません。示されたモデル規模は、すべてのPCで同じ性能が出るという保証ではなく、システムが狙う提供範囲の例として見るべきです。実際の結果は、モデル、構成、ワークロードに左右されます。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
RouteFMが示す、LLMルーティングの「一度学習してどこでも振り分ける」発想
推論・デプロイ
cctest.ai
推論・デプロイ

RouteFMが示す、LLMルーティングの「一度学習してどこでも振り分ける」発想

RouteFMは、LLMルーティングを環境ごとの再学習ではなく、再利用可能な基盤能力として捉える。匿名の候補モデルを少量の行動データから評価し、異なるタスクやモデルプールへ適応する。

続きを読む
CCTest · Blog
HelionをvLLMに統合、量子化GEMMを自動調整する推論バックエンド
推論・デプロイ
cctest.ai
推論・デプロイ

HelionをvLLMに統合、量子化GEMMを自動調整する推論バックエンド

PyTorchはHelionをvLLMのlinear backendに統合し、高水準のカーネルDSLと形状別自動チューニングで、量子化GEMMの実装を簡素化する可能性を検証しました。NVIDIA Hopperでは、評価対象の一部ワークロードで10%超のスループット向上が確認されています。

続きを読む
CCTest · Blog
MALA:注意の寄与度に応じて計算量を配分するAttention
推論・デプロイ
cctest.ai
推論・デプロイ

MALA:注意の寄与度に応じて計算量を配分するAttention

MassAlloc Attention(MALA)は、合法な因果関係のQKスコアをすべて参照しながら、正規化された注意量に基づいて低寄与領域の後段計算を削減する。FullAttnに近い精度を保ちつつ、長文脈での計算を適応的に減らす手法だ。

続きを読む