記事とガイド

推論・デプロイ

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 29 件の記事

CCTest · Blog
vLLMのArm CPU最適化:LLM推論を「動く」から「使える」へ
推論・デプロイ
cctest.ai
推論・デプロイ

vLLMのArm CPU最適化:LLM推論を「動く」から「使える」へ

vLLMはPyTorch、oneDNN、KleidiAIなどのコミュニティと連携し、Arm Neoverseサーバー向けの推論スタックを改善した。対象は配布物、メモリアロケータ、同期処理、BF16密行列層、paged attentionまで広い。

続きを読む
CCTest · Blog
vLLM、推測デコードを単一トークン生成の先へ:P-EAGLE・DFlash・DSparkをサポート
推論・デプロイ
cctest.ai
推論・デプロイ

vLLM、推測デコードを単一トークン生成の先へ:P-EAGLE・DFlash・DSparkをサポート

vLLMとSpeculatorsは、P-EAGLE、DFlash、DSparkという3つの並列ドラフティング手法をオープンソースでサポートした。狙いは、候補トークンを逐次生成する構造的な制約を緩和し、LLMサービングの高速化と運用の簡素化を進めることにある。

続きを読む
CCTest · Blog
vLLM、Kimi K3 の Day-0 推論サポートを公開
推論・デプロイ
cctest.ai
推論・デプロイ

vLLM、Kimi K3 の Day-0 推論サポートを公開

vLLM は Kimi K3 の重み公開に合わせ、混合 KDA プレフィックスキャッシュ、DSpark 投機的デコード、分離型デプロイ、NVIDIA・AMD GPU 向け最適化を含む推論サポートを発表した。焦点はモデルを読み込むことではなく、巨大なハイブリッド MoE を実運用に近づけることにある。

続きを読む
CCTest · Blog
RunwayのMedia Router、生成メディア競争を「モデル運用」へ押し出す
推論・デプロイ
cctest.ai
推論・デプロイ

RunwayのMedia Router、生成メディア競争を「モデル運用」へ押し出す

Runwayは、画像・動画・音声生成モデルをリクエストごとに自動選択するMedia Routerを発表した。品質、速度、コストを軸にルーティングする仕組みで、生成メディア市場が単一モデル競争から基盤レイヤー競争へ移りつつあることを示している。

続きを読む
CCTest · Blog
モデルルーティングは単なる「モデル選択」ではない:IBM Research が示す企業向け Agent の現実
推論・デプロイ
cctest.ai
推論・デプロイ

モデルルーティングは単なる「モデル選択」ではない:IBM Research が示す企業向け Agent の現実

IBM Research は、Agent システムにおけるモデルルーティングを分類問題として扱うだけでは不十分だと指摘する。実運用では、コスト、品質、遅延、キャッシュ、インフラ、ガバナンスを同時に考える必要がある。

続きを読む
CCTest · Blog
モデル最適化を経験則から制約駆動の設計判断へ
推論・デプロイ
cctest.ai
推論・デプロイ

モデル最適化を経験則から制約駆動の設計判断へ

この arXiv 論文は、モデル圧縮と推論高速化を単なる手法選択ではなく、運用制約に基づく多目的なエンジニアリング判断として捉え直している。鍵となるのはデータ、遅延、メモリ、精度、再学習予算の五つの軸だ。

続きを読む
CCTest · Blog
vLLM、TML InklingをDay-0対応:1Tマルチモーダルモデルの推論最適化を前面に
推論・デプロイ
cctest.ai
推論・デプロイ

vLLM、TML InklingをDay-0対応:1Tマルチモーダルモデルの推論最適化を前面に

vLLMは、Thinking Machines Labの1Tパラメータ級マルチモーダルモデル TML Inkling にDay-0対応した。MTP、長文コンテキスト、MoE、並列化、キャッシュ管理まで踏み込んだ統合となっている。

続きを読む