記事一覧へ戻る
計算資源・チップ

雲天励飛の推論チップ構想、焦点はピーク性能からTokenコストへ

読了目安 3 分

導入

大規模モデルが実験段階から日常的なサービス基盤へ広がるにつれ、推論コストはAIインフラの最重要課題になりつつある。雲天励飛はWAICで、今後2年超を見据えたAI推論チップのロードマップを発表した。DeepVerse100P、DeepVerse100D、DeepVerse100Lの3製品を、Prefill、Decode、Decode段階のFFN向けに分け、万カード級の異種混在クラスタで協調動作させる構想だ。

重要ポイント

  • 推論処理を段階ごとに最適化する。 Prefillは入力コンテキストをまとめて処理するため、長文コンテキストでは計算負荷が高い。一方、Decodeは1Tokenずつ生成するため、メモリ帯域、データアクセス効率、尾部遅延に敏感になる。MoEなどの構造では、Decode内部のAttentionとFFNも異なるリソースを必要とする。
  • 3種類のチップが別々のボトルネックを狙う。 DeepVerse100Pは百万級コンテキストのPrefillを対象とし、長文処理がDecodeの生成スループットを圧迫する問題を抑える。DeepVerse100DはDecode向けで、主流チップを上回るメモリ帯域、1024カードScale-up、光インターコネクトによって通信混雑や尾部遅延の低減を目指す。DeepVerse100LはDecode FFN向けで、3D Memory構造と低遅延チップ間接続により、計算と通信の並列性を高める。
  • 単体性能よりクラスタ効率を重視する。 同社の考え方は、Prefill、Decode、FFNを別々のリソースプールに分け、高速インターコネクトで結ぶものだ。これにより、Token生成の全工程でリソース競合を減らし、利用率を高めようとしている。
  • ソフトウェアスタックが実用性を左右する。 IFWAはPyTorch ATen、vLLM、SGLangなどへの対応を進め、量子化、圧縮、コンパイル、デプロイを支援する。さらに、Houmao多Agent異種プログラミングフレームワークのオープンソース化や、Triton演算子能力のFlagOSへの統合も示された。

意味と影響

このロードマップは、推論チップ競争がピーク演算性能だけでは測れなくなっていることを示す。長いコンテキスト、複雑な推論連鎖、Agent型アプリケーションでは、計算、メモリ、ネットワークへの負荷が均一ではない。段階ごとに専用化したクラスタは、混載によるリソース奪い合いを減らせる可能性がある。

ただし、異種混在推論システムは運用難度も高い。モデル移植、算子最適化、コンパイラ、通信、スケジューリングが噛み合わなければ、コスト低減は実運用で現れにくい。雲天励飛が掲げる「百億Token一分钱」という長期目標は、完成済みの成果というより、国産AI計算基盤が「使える」段階から「使いやすく、安く、大規模に使える」段階へ進むための方向性と見るべきだ。

出典:InfoQ 中文

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
WAIC 2026で奇異摩爾が示した、国産GPU直結通信の次の一手
計算資源・チップ
cctest.ai
計算資源・チップ

WAIC 2026で奇異摩爾が示した、国産GPU直結通信の次の一手

奇異摩爾はWAIC 2026で、国産GPUと国産RDMA NICを直結するIBGDAデモ、超ノード向けの全栈相互接続方案、そしてCPO白書を披露した。単なる製品紹介ではなく、国産AI基盤を“つなぐ力”で底上げする狙いが見える。

続きを読む
CCTest · Blog
安謀科技、エッジ AI を CPU・NPU・VPU・AIOS の総合設計として提示
計算資源・チップ
cctest.ai
計算資源・チップ

安謀科技、エッジ AI を CPU・NPU・VPU・AIOS の総合設計として提示

WAIC 2026 で安謀科技が示したのは、単体アクセラレータではなく、制約の多い端末側で AI を動かすためのシステム設計だった。CPU、NPU、VPU、AIOS を組み合わせ、ローカル AI 基盤を構成しようとしている。

続きを読む