記事とガイド

推論・デプロイ

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 29 件の記事

CCTest · Blog
TileMix、ハードウェアタイル単位でLLM注意機構の精度を切り替え
推論・デプロイ
cctest.ai
推論・デプロイ

TileMix、ハードウェアタイル単位でLLM注意機構の精度を切り替え

TileMixは、融合された密な注意機構カーネルの中で、スコアタイルごとにFP16とINT8を使い分けます。トークン間の接続を削らず、長文脈プリフィルの精度とスループットの両立を目指します。

続きを読む
CCTest · Blog
4ビットLLMをどう「修復」するか:QATの課題を避けるQAH
推論・デプロイ
cctest.ai
推論・デプロイ

4ビットLLMをどう「修復」するか:QATの課題を避けるQAH

構造的圧縮と4ビット量子化を重ねると、推論や数学、コーディング、長文脈の性能が低下しやすい。Multiverse Computingは、元の非圧縮モデルから直接蒸留するQuantization-Aware Healing(QAH)を提案した。

続きを読む
CCTest · Blog
4ビットモデルがBF16版を上回る理由、QAHの仕組み
推論・デプロイ
cctest.ai
推論・デプロイ

4ビットモデルがBF16版を上回る理由、QAHの仕組み

Multiverse Computingは、構造圧縮と4ビット量子化を受けたモデルを、圧縮前の大規模モデルから直接蒸留するQAHを発表しました。GPT-OSSを使った実験では、60BのMXFP4モデルが9指標中7指標で同じ構成のBF16版を上回りました。

続きを読む
CCTest · Blog
ParaTempo、時間的信頼度で並列推論を動的に最適化
推論・デプロイ
cctest.ai
推論・デプロイ

ParaTempo、時間的信頼度で並列推論を動的に最適化

ParaTempo は、各推論ブランチが時間とともにどれだけ答えの候補へ収束するかを測る、学習不要の非同期並列推論フレームワークです。信頼度に応じて枝刈りや早期終了、新しいブランチへの計算資源の再配分を行います。

続きを読む
CCTest · Blog
Daedalus-150M、CPU推論を起点に設計した畳み込み・注意融合モデル
推論・デプロイ
cctest.ai
推論・デプロイ

Daedalus-150M、CPU推論を起点に設計した畳み込み・注意融合モデル

Daedalus-150M は、大規模モデルを縮小してから CPU に載せるのではなく、4bit重み・単一ユーザー・逐次デコードという運用条件から逆算して設計された小型言語モデルです。18ブロックのうち12ブロックを短い畳み込みに置き換え、長いコンテキストでの KV キャッシュ読み出しを抑えます。

続きを読む
CCTest · Blog
Nexus、ツール仕様の再読み込みを避けるエージェント推論
推論・デプロイ
cctest.ai
推論・デプロイ

Nexus、ツール仕様の再読み込みを避けるエージェント推論

Nexus は、MCP エージェントが毎ターンすべてのツールスキーマを再エンコードする問題を、検索ベースのルーティングによって切り離す。KV キャッシュの連結も試すが、RoPE の位置ずれが適用範囲を制限する。

続きを読む
CCTest · Blog
Llama-Mobile、2.7ビット量子化で視覚言語モデルのモバイル展開を目指す
推論・デプロイ
cctest.ai
推論・デプロイ

Llama-Mobile、2.7ビット量子化で視覚言語モデルのモバイル展開を目指す

Llama-Mobileは、限られたメモリと計算資源しか持たない端末向けに、視覚言語モデルを量子化するフレームワークを提案します。モデル自身が生成したデータとArm CPUでの実行を意識した2.7ビット形式により、Llama 3.2 11B Vision Instructを3.7 GBまで圧縮し、標準的な視覚質問応答で高い性能を維持しました。

続きを読む
CCTest · Blog
FlashPrefill V2、長文脈LLMの疎なプリフィルを実運用へ
推論・デプロイ
cctest.ai
推論・デプロイ

FlashPrefill V2、長文脈LLMの疎なプリフィルを実運用へ

FlashPrefill V2は、平均補正項とGPU向けの疎注意演算子、ページングKVキャッシュや連続バッチ処理への対応を組み合わせ、長文脈LLMのプリフィルを実運用に近づける。NVIDIA H20の128K文脈では、FP8でFlashAttention-2比最大47.26倍の高速化を報告している。

続きを読む
CCTest · Blog
Ramp、企業向けAIモデルルーター「Router」を開始
推論・デプロイ
cctest.ai
推論・デプロイ

Ramp、企業向けAIモデルルーター「Router」を開始

企業向け経費管理プラットフォームのRampが、複数の大規模言語モデルを1つのAPIから利用・切り替えできるAIモデルルーティングサービス「Router」を開始した。現時点では米国のみで提供され、2026年末まではルーティング料金が無料となる。

続きを読む
CCTest · Blog
FreeToken、個人PCを大規模MoE推論の弾性基盤に
推論・デプロイ
cctest.ai
推論・デプロイ

FreeToken、個人PCを大規模MoE推論の弾性基盤に

FreeTokenは、異なる構成の個人向けハードウェアで大規模なMixture-of-Expertsモデルを動かすためのエッジネイティブな推論基盤です。PCを単なる小型GPUではなく、CPUやGPU、メモリを統合して使うプラットフォームとして捉え直します。

続きを読む
CCTest · Blog
退役GPUはどこまで使えるか?DumpsterClusterがLLaMA-70Bを推論
推論・デプロイ
cctest.ai
推論・デプロイ

退役GPUはどこまで使えるか?DumpsterClusterがLLaMA-70Bを推論

DumpsterClusterの研究は、退役したGPUを組み合わせても大規模言語モデルの推論基盤を構築できることを示した。一方で、低い導入費用だけでは十分ではなく、電気料金と電力の炭素強度が採算性と環境性能を左右する。

続きを読む
CCTest · Blog
AIクレジット転売市場の台頭:Token Broker が生む新たなリスク
推論・デプロイ
cctest.ai
推論・デプロイ

AIクレジット転売市場の台頭:Token Broker が生む新たなリスク

セキュリティ研究記事は、スタートアップが使い切れない AI API クレジットを買い取り、割引価格で再販売する「token broker」の存在を追跡している。推論リソースが疑似通貨のように流通し始め、コスト削減の裏で安全性とコンプライアンスの課題が浮上している。

続きを読む
CCTest · Blog
LiveAnimate:長尺の人物アニメーションをリアルタイム配信へ
推論・デプロイ
cctest.ai
推論・デプロイ

LiveAnimate:長尺の人物アニメーションをリアルタイム配信へ

LiveAnimate は、姿勢駆動の人物アニメーションにおける「高品質だが遅い」という課題に正面から取り組む研究です。14B パラメータの動画 DiT を、長時間でも安定して動くストリーミング推論システムへと再設計しています。

続きを読む
CCTest · Blog
UniMoMo:推薦 MoE を専門家マージで軽量化する手法
推論・デプロイ
cctest.ai
推論・デプロイ

UniMoMo:推薦 MoE を専門家マージで軽量化する手法

UniMoMo は、学習済みの推薦向け MoE モデルを、より少ない専門家数の標準 MoE へ変換する後処理圧縮フレームワークです。重みの近さではなく、校正データ上での振る舞いとルーティング量を見て専門家を統合します。

続きを読む
CCTest · Blog
vLLM の DCP、長文脈推論における KV キャッシュの壁を崩す
推論・デプロイ
cctest.ai
推論・デプロイ

vLLM の DCP、長文脈推論における KV キャッシュの壁を崩す

vLLM の Decode Context Parallelism(DCP)は、KV キャッシュを注意ヘッドではなくシーケンス方向に分割する。長文脈エージェント負荷で顕在化する GPU メモリ不足を緩和し、高並行時のスループット改善を狙う仕組みだ。

続きを読む
CCTest · Blog
GPTQ-2D:双方向の適応的丸めを4次時間から3次時間へ
推論・デプロイ
cctest.ai
推論・デプロイ

GPTQ-2D:双方向の適応的丸めを4次時間から3次時間へ

GPTQ-2D は、残差の左側と右側の両方に基底行列が作用する、より一般的な適応的丸め問題を扱う。行列を単純にベクトル化する方法と同じ丸め結果を保ちながら、反対角線ごとの処理で計算量を3次時間に下げる。

続きを読む
CCTest · Blog
OmniScope:音声と映像の重要度を分けて圧縮する OmniLLM 推論手法
推論・デプロイ
cctest.ai
推論・デプロイ

OmniScope:音声と映像の重要度を分けて圧縮する OmniLLM 推論手法

OmniScope は、音声と映像の関連度が同じタイミングで高まるとは限らない点に着目した、学習不要の Token 圧縮フレームワークです。クエリを共通の意味アンカーにしつつ、各モダリティの重要度を別々に推定します。

続きを読む
CCTest · Blog
投機的デコーディングの有損検証を再考する:高速化の裏にある分布の歪み
推論・デプロイ
cctest.ai
推論・デプロイ

投機的デコーディングの有損検証を再考する:高速化の裏にある分布の歪み

この論文は、投機的デコーディングにおける有損検証が、推論効率を高める一方で生成分布を静かに変えてしまう可能性を分析している。速度向上は、品質安定性とのトレードオフとして捉える必要がある。

続きを読む