FreeToken、個人PCを大規模MoE推論の弾性基盤に
導入
オープンウェイトモデルの性能は急速に高まっていますが、その提供方法は依然としてデータセンターのGPUを前提にしがちです。個人向けPCでは、GPUメモリの容量だけでなく、システムメモリの帯域、CPUとGPUのデータ転送、さらにエージェントが蓄積する状態がボトルネックになります。FreeTokenは、個人PCを性能の低いGPUとして扱うのではなく、複数の資源を実行時に組み合わせる弾性的な推論プラットフォームとして捉えます。
主なポイント
- MoEに合わせて提供スタックを再設計。 モデルの配置とロード、エキスパートの常駐、CPU-GPU間の実行、エージェント状態の再利用、実行時のメモリ管理をまとめて設計しています。
- 帯域に応じた動的な配置。 PCごとにGPUメモリ、システムメモリ、CPU性能、転送帯域のバランスは異なります。FreeTokenはCPUとGPUの役割を固定せず、利用可能な資源へ計算とモデル状態を継続的に割り当てます。
- 変化するエージェント処理に対応。 コーディングエージェントやツール利用エージェントでは、セッション中に実行パターンが変わります。FreeTokenは、エキスパートへのアクセスや状態の変化を実行時の課題として扱い、状態の再利用を組み込みます。
- ローカルで扱える範囲を拡大。 20以上のMoEモデルを、8GB GPUのノートPCから単一ワークステーションGPUまででサポートします。論文が挙げる例は、ノートPCで35B、ゲーミングPCで284B、単一ワークステーションGPUで753BのGLM-5.2です。
意義と影響
FreeTokenの焦点は、単に大きなモデルを小さな機器へ押し込むことではありません。GPUメモリに全パラメータを置けない場合、どのエキスパートを常駐させ、どの状態を再利用し、CPUや別のメモリ資源をいつ使うかが重要になります。MoEではトークンごとに一部のエキスパートだけが選ばれますが、エキスパートの重みを移動するコストは応答性を左右します。そのため、固定的な分割よりも、実行時の配置変更に意味があります。
この考え方は、オープンウェイトを「ダウンロードできるモデル」から「ローカルで運用できるソフトウェア」へ近づける可能性があります。一方、提供された素材には、各ハードウェアを同一条件で比較したスループット、初回トークン遅延、生成速度、消費電力の数値はありません。示されたモデル規模は、すべてのPCで同じ性能が出るという保証ではなく、システムが狙う提供範囲の例として見るべきです。実際の結果は、モデル、構成、ワークロードに左右されます。
コメント
ログイン状態を確認中…
コメントを読み込み中…