vLLMのArm CPU最適化:LLM推論を「動く」から「使える」へ
vLLMはPyTorch、oneDNN、KleidiAIなどのコミュニティと連携し、Arm Neoverseサーバー向けの推論スタックを改善した。対象は配布物、メモリアロケータ、同期処理、BF16密行列層、paged attentionまで広い。
続きを読むvLLMはPyTorch、oneDNN、KleidiAIなどのコミュニティと連携し、Arm Neoverseサーバー向けの推論スタックを改善した。対象は配布物、メモリアロケータ、同期処理、BF16密行列層、paged attentionまで広い。
続きを読むAi2 は Hugging Face Blog で、地球観測基盤モデルを実運用に乗せるための OlmoEarth Platform を紹介した。焦点はモデルそのものだけでなく、衛星データ処理と大規模推論のインフラにある。
続きを読むvLLMとSpeculatorsは、P-EAGLE、DFlash、DSparkという3つの並列ドラフティング手法をオープンソースでサポートした。狙いは、候補トークンを逐次生成する構造的な制約を緩和し、LLMサービングの高速化と運用の簡素化を進めることにある。
続きを読むvLLM は Kimi K3 の重み公開に合わせ、混合 KDA プレフィックスキャッシュ、DSpark 投機的デコード、分離型デプロイ、NVIDIA・AMD GPU 向け最適化を含む推論サポートを発表した。焦点はモデルを読み込むことではなく、巨大なハイブリッド MoE を実運用に近づけることにある。
続きを読むRunwayは、画像・動画・音声生成モデルをリクエストごとに自動選択するMedia Routerを発表した。品質、速度、コストを軸にルーティングする仕組みで、生成メディア市場が単一モデル競争から基盤レイヤー競争へ移りつつあることを示している。
続きを読むIBM Research は、Agent システムにおけるモデルルーティングを分類問題として扱うだけでは不十分だと指摘する。実運用では、コスト、品質、遅延、キャッシュ、インフラ、ガバナンスを同時に考える必要がある。
続きを読むこの arXiv 論文は、モデル圧縮と推論高速化を単なる手法選択ではなく、運用制約に基づく多目的なエンジニアリング判断として捉え直している。鍵となるのはデータ、遅延、メモリ、精度、再学習予算の五つの軸だ。
続きを読むvLLMは、Thinking Machines Labの1Tパラメータ級マルチモーダルモデル TML Inkling にDay-0対応した。MTP、長文コンテキスト、MoE、並列化、キャッシュ管理まで踏み込んだ統合となっている。
続きを読む