記事とガイド

推論・デプロイ

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 40 件の記事

CCTest · Blog
FreeToken、コンシューマーGPU向けMoE推論を再設計
推論・デプロイ
cctest.ai
推論・デプロイ

FreeToken、コンシューマーGPU向けMoE推論を再設計

バークリー校とMITの研究者が、システムメモリとGPUの間でMoEの専門家重みを効率的に移動させるオープンソース推論エンジンFreeTokenを公開した。論文のベンチマークでは、RTX 4060搭載ノートPCでQwen3.6-35Bが毎秒約39トークンに達したとされる。

続きを読む
CCTest · Blog
CRISP、構造を利用して長文脈の疎なプリフィルを改善
推論・デプロイ
cctest.ai
推論・デプロイ

CRISP、構造を利用して長文脈の疎なプリフィルを改善

CRISPは、入力に応じて変化する疎な注意機構のために、注意マップを直接読む構造指標と、sinkを考慮した閾値を提案します。動的ルーティングの計算負荷と、長い文脈で増える背景ノイズの双方を抑えることが狙いです。

続きを読む
CCTest · Blog
言語モデルが自分で見る場所を決める:Declarative Attention
推論・デプロイ
cctest.ai
推論・デプロイ

言語モデルが自分で見る場所を決める:Declarative Attention

Declarative Attentionは、長いコンテキストのどの領域が必要かをモデル自身に宣言させ、KVキャッシュの読み出しを省く仕組みです。評価では大幅な読み出し削減が示された一方、精度には小さな低下が生じました。

続きを読む
CCTest · Blog
企業の多様なリクエストを1つの自社運用LLMに集約する方法
推論・デプロイ
cctest.ai
推論・デプロイ

企業の多様なリクエストを1つの自社運用LLMに集約する方法

200以上の社内アプリケーションのトラフィックを、1つの自社運用モデルに集約するポストトレーニング手法が報告された。指示追従、関数呼び出し、社内タスク分布ごとにGRPO専門家を学習し、2段階SLERPで統合する。

続きを読む
CCTest · Blog
検証を予測する草稿モデルへ:VATが投機的デコードを改善
推論・デプロイ
cctest.ai
推論・デプロイ

検証を予測する草稿モデルへ:VATが投機的デコードを改善

NAVER AI Labは、投機的デコードの逐次検証を草稿モデルの学習に組み込むVerification-Aware Training(VAT)を提案した。モデル構造や推論手順を変更せず、受理されるトークン列の長さと実測速度の改善を狙う。

続きを読む
CCTest · Blog
MiniMax H3のリアルタイム配信に必要なのはDiTの高速化だけではない
推論・デプロイ
cctest.ai
推論・デプロイ

MiniMax H3のリアルタイム配信に必要なのはDiTの高速化だけではない

vLLM-Omniは、MiniMax H3をエンコーダーからMP4生成までのシステム全体として最適化した。さらにFastVideoのFastH3を組み合わせ、DiTの前向き計算を4回に削減することで、完全な応答を再生時間に近づけている。

続きを読む
CCTest · Blog
スライディングウィンドウ注意機構は線形注意機構を上回るのか
推論・デプロイ
cctest.ai
推論・デプロイ

スライディングウィンドウ注意機構は線形注意機構を上回るのか

複数のモデルとタスクを比較した研究で、アテンションシンクを備えたスライディングウィンドウ注意機構が、追加のポストトレーニングなしで、改造された線形注意機構と同等以上の性能を示しました。長文脈推論では差がさらに大きくなっています。

続きを読む
CCTest · Blog
ベクトル検索でLLMの出力層を高速化する新しい推論手法
推論・デプロイ
cctest.ai
推論・デプロイ

ベクトル検索でLLMの出力層を高速化する新しい推論手法

LLMの出力射影とTop-k選択を最大内積検索として捉え直し、HNSWベースのベクトルインデックスで候補トークンだけを取得する研究が示された。小バッチのCPU推論におけるメモリ帯域ボトルネックの緩和を狙う。

続きを読む
CCTest · Blog
TileMix、ハードウェアタイル単位でLLM注意機構の精度を切り替え
推論・デプロイ
cctest.ai
推論・デプロイ

TileMix、ハードウェアタイル単位でLLM注意機構の精度を切り替え

TileMixは、融合された密な注意機構カーネルの中で、スコアタイルごとにFP16とINT8を使い分けます。トークン間の接続を削らず、長文脈プリフィルの精度とスループットの両立を目指します。

続きを読む
CCTest · Blog
4ビットLLMをどう「修復」するか:QATの課題を避けるQAH
推論・デプロイ
cctest.ai
推論・デプロイ

4ビットLLMをどう「修復」するか:QATの課題を避けるQAH

構造的圧縮と4ビット量子化を重ねると、推論や数学、コーディング、長文脈の性能が低下しやすい。Multiverse Computingは、元の非圧縮モデルから直接蒸留するQuantization-Aware Healing(QAH)を提案した。

続きを読む
CCTest · Blog
4ビットモデルがBF16版を上回る理由、QAHの仕組み
推論・デプロイ
cctest.ai
推論・デプロイ

4ビットモデルがBF16版を上回る理由、QAHの仕組み

Multiverse Computingは、構造圧縮と4ビット量子化を受けたモデルを、圧縮前の大規模モデルから直接蒸留するQAHを発表しました。GPT-OSSを使った実験では、60BのMXFP4モデルが9指標中7指標で同じ構成のBF16版を上回りました。

続きを読む
CCTest · Blog
Daedalus-150M、CPU推論を起点に設計した畳み込み・注意融合モデル
推論・デプロイ
cctest.ai
推論・デプロイ

Daedalus-150M、CPU推論を起点に設計した畳み込み・注意融合モデル

Daedalus-150M は、大規模モデルを縮小してから CPU に載せるのではなく、4bit重み・単一ユーザー・逐次デコードという運用条件から逆算して設計された小型言語モデルです。18ブロックのうち12ブロックを短い畳み込みに置き換え、長いコンテキストでの KV キャッシュ読み出しを抑えます。

続きを読む
CCTest · Blog
ParaTempo、時間的信頼度で並列推論を動的に最適化
推論・デプロイ
cctest.ai
推論・デプロイ

ParaTempo、時間的信頼度で並列推論を動的に最適化

ParaTempo は、各推論ブランチが時間とともにどれだけ答えの候補へ収束するかを測る、学習不要の非同期並列推論フレームワークです。信頼度に応じて枝刈りや早期終了、新しいブランチへの計算資源の再配分を行います。

続きを読む
CCTest · Blog
Nexus、ツール仕様の再読み込みを避けるエージェント推論
推論・デプロイ
cctest.ai
推論・デプロイ

Nexus、ツール仕様の再読み込みを避けるエージェント推論

Nexus は、MCP エージェントが毎ターンすべてのツールスキーマを再エンコードする問題を、検索ベースのルーティングによって切り離す。KV キャッシュの連結も試すが、RoPE の位置ずれが適用範囲を制限する。

続きを読む
CCTest · Blog
Llama-Mobile、2.7ビット量子化で視覚言語モデルのモバイル展開を目指す
推論・デプロイ
cctest.ai
推論・デプロイ

Llama-Mobile、2.7ビット量子化で視覚言語モデルのモバイル展開を目指す

Llama-Mobileは、限られたメモリと計算資源しか持たない端末向けに、視覚言語モデルを量子化するフレームワークを提案します。モデル自身が生成したデータとArm CPUでの実行を意識した2.7ビット形式により、Llama 3.2 11B Vision Instructを3.7 GBまで圧縮し、標準的な視覚質問応答で高い性能を維持しました。

続きを読む