記事一覧へ戻る
計算資源・チップ

雲天励飛の推論チップ構想、焦点はピーク性能からTokenコストへ

読了目安 3 分

導入

大規模モデルが実験段階から日常的なサービス基盤へ広がるにつれ、推論コストはAIインフラの最重要課題になりつつある。雲天励飛はWAICで、今後2年超を見据えたAI推論チップのロードマップを発表した。DeepVerse100P、DeepVerse100D、DeepVerse100Lの3製品を、Prefill、Decode、Decode段階のFFN向けに分け、万カード級の異種混在クラスタで協調動作させる構想だ。

重要ポイント

  • 推論処理を段階ごとに最適化する。 Prefillは入力コンテキストをまとめて処理するため、長文コンテキストでは計算負荷が高い。一方、Decodeは1Tokenずつ生成するため、メモリ帯域、データアクセス効率、尾部遅延に敏感になる。MoEなどの構造では、Decode内部のAttentionとFFNも異なるリソースを必要とする。
  • 3種類のチップが別々のボトルネックを狙う。 DeepVerse100Pは百万級コンテキストのPrefillを対象とし、長文処理がDecodeの生成スループットを圧迫する問題を抑える。DeepVerse100DはDecode向けで、主流チップを上回るメモリ帯域、1024カードScale-up、光インターコネクトによって通信混雑や尾部遅延の低減を目指す。DeepVerse100LはDecode FFN向けで、3D Memory構造と低遅延チップ間接続により、計算と通信の並列性を高める。
  • 単体性能よりクラスタ効率を重視する。 同社の考え方は、Prefill、Decode、FFNを別々のリソースプールに分け、高速インターコネクトで結ぶものだ。これにより、Token生成の全工程でリソース競合を減らし、利用率を高めようとしている。
  • ソフトウェアスタックが実用性を左右する。 IFWAはPyTorch ATen、vLLM、SGLangなどへの対応を進め、量子化、圧縮、コンパイル、デプロイを支援する。さらに、Houmao多Agent異種プログラミングフレームワークのオープンソース化や、Triton演算子能力のFlagOSへの統合も示された。

意味と影響

このロードマップは、推論チップ競争がピーク演算性能だけでは測れなくなっていることを示す。長いコンテキスト、複雑な推論連鎖、Agent型アプリケーションでは、計算、メモリ、ネットワークへの負荷が均一ではない。段階ごとに専用化したクラスタは、混載によるリソース奪い合いを減らせる可能性がある。

ただし、異種混在推論システムは運用難度も高い。モデル移植、算子最適化、コンパイラ、通信、スケジューリングが噛み合わなければ、コスト低減は実運用で現れにくい。雲天励飛が掲げる「百億Token一分钱」という長期目標は、完成済みの成果というより、国産AI計算基盤が「使える」段階から「使いやすく、安く、大規模に使える」段階へ進むための方向性と見るべきだ。

出典:InfoQ 中文

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
NVIDIAがMediaTekに35億ドル投資、カスタムAIチップも自社基盤へ
計算資源・チップ
cctest.ai
計算資源・チップ

NVIDIAがMediaTekに35億ドル投資、カスタムAIチップも自社基盤へ

NVIDIAはMediaTekに35億ドルを投資し、NVLink Fusionエコシステムへの参加を進める。大手クラウド企業が独自AIチップを開発する中でも、NVIDIAのデータセンター基盤を使い続けてもらう狙いがある。

続きを読む
CCTest · Blog
NVIDIAのAI優位性はGPUの先へ、システム設計が新たな焦点に
計算資源・チップ
cctest.ai
計算資源・チップ

NVIDIAのAI優位性はGPUの先へ、システム設計が新たな焦点に

AIデータセンターがギガワット級へ拡大するにつれ、性能を左右するのはGPUの数だけではなくなっている。NVIDIAはデータ、メモリ、ストレージ、ネットワークを連携させるシステム層へ優位性を広げようとしている。

続きを読む