同じモデルなのにローカル版が劣る理由、推論スタックの数値差に注目
長文脈の実験では、モデルの重みとGPUが同じでも、注意機構のバックエンド、KVキャッシュ、量子化、マルチGPU通信が次のTokenを変えうることが示された。
続きを読む長文脈の実験では、モデルの重みとGPUが同じでも、注意機構のバックエンド、KVキャッシュ、量子化、マルチGPU通信が次のTokenを変えうることが示された。
続きを読むTileMixは、融合された密な注意機構カーネルの中で、スコアタイルごとにFP16とINT8を使い分けます。トークン間の接続を削らず、長文脈プリフィルの精度とスループットの両立を目指します。
続きを読む構造的圧縮と4ビット量子化を重ねると、推論や数学、コーディング、長文脈の性能が低下しやすい。Multiverse Computingは、元の非圧縮モデルから直接蒸留するQuantization-Aware Healing(QAH)を提案した。
続きを読むMultiverse Computingは、構造圧縮と4ビット量子化を受けたモデルを、圧縮前の大規模モデルから直接蒸留するQAHを発表しました。GPT-OSSを使った実験では、60BのMXFP4モデルが9指標中7指標で同じ構成のBF16版を上回りました。
続きを読むParaTempo は、各推論ブランチが時間とともにどれだけ答えの候補へ収束するかを測る、学習不要の非同期並列推論フレームワークです。信頼度に応じて枝刈りや早期終了、新しいブランチへの計算資源の再配分を行います。
続きを読むDaedalus-150M は、大規模モデルを縮小してから CPU に載せるのではなく、4bit重み・単一ユーザー・逐次デコードという運用条件から逆算して設計された小型言語モデルです。18ブロックのうち12ブロックを短い畳み込みに置き換え、長いコンテキストでの KV キャッシュ読み出しを抑えます。
続きを読むNexus は、MCP エージェントが毎ターンすべてのツールスキーマを再エンコードする問題を、検索ベースのルーティングによって切り離す。KV キャッシュの連結も試すが、RoPE の位置ずれが適用範囲を制限する。
続きを読むLlama-Mobileは、限られたメモリと計算資源しか持たない端末向けに、視覚言語モデルを量子化するフレームワークを提案します。モデル自身が生成したデータとArm CPUでの実行を意識した2.7ビット形式により、Llama 3.2 11B Vision Instructを3.7 GBまで圧縮し、標準的な視覚質問応答で高い性能を維持しました。
続きを読むvLLMの実践ガイドは、ROCm環境のAMD Instinct GPUで投機的デコーディングを使う方法を解説しています。ネイティブMTP、EAGLE-3、DFlash、DSparkを比較し、実際の効果は受理率とワークロードに左右されると説明します。
続きを読む同じモデルの重みでも、GPU、量子化、推論ランタイム、注意機構のカーネルが違えば出力は変わり得ます。性能低下の原因はモデルではなく、推論スタックにあるのかもしれません。
続きを読むFlashPrefill V2は、平均補正項とGPU向けの疎注意演算子、ページングKVキャッシュや連続バッチ処理への対応を組み合わせ、長文脈LLMのプリフィルを実運用に近づける。NVIDIA H20の128K文脈では、FP8でFlashAttention-2比最大47.26倍の高速化を報告している。
続きを読む企業向け経費管理プラットフォームのRampが、複数の大規模言語モデルを1つのAPIから利用・切り替えできるAIモデルルーティングサービス「Router」を開始した。現時点では米国のみで提供され、2026年末まではルーティング料金が無料となる。
続きを読むFreeTokenは、異なる構成の個人向けハードウェアで大規模なMixture-of-Expertsモデルを動かすためのエッジネイティブな推論基盤です。PCを単なる小型GPUではなく、CPUやGPU、メモリを統合して使うプラットフォームとして捉え直します。
続きを読むDumpsterClusterの研究は、退役したGPUを組み合わせても大規模言語モデルの推論基盤を構築できることを示した。一方で、低い導入費用だけでは十分ではなく、電気料金と電力の炭素強度が採算性と環境性能を左右する。
続きを読むセキュリティ研究記事は、スタートアップが使い切れない AI API クレジットを買い取り、割引価格で再販売する「token broker」の存在を追跡している。推論リソースが疑似通貨のように流通し始め、コスト削減の裏で安全性とコンプライアンスの課題が浮上している。
続きを読むLiveAnimate は、姿勢駆動の人物アニメーションにおける「高品質だが遅い」という課題に正面から取り組む研究です。14B パラメータの動画 DiT を、長時間でも安定して動くストリーミング推論システムへと再設計しています。
続きを読むUniMoMo は、学習済みの推薦向け MoE モデルを、より少ない専門家数の標準 MoE へ変換する後処理圧縮フレームワークです。重みの近さではなく、校正データ上での振る舞いとルーティング量を見て専門家を統合します。
続きを読むvLLM の Decode Context Parallelism(DCP)は、KV キャッシュを注意ヘッドではなくシーケンス方向に分割する。長文脈エージェント負荷で顕在化する GPU メモリ不足を緩和し、高並行時のスループット改善を狙う仕組みだ。
続きを読むGPTQ-2D は、残差の左側と右側の両方に基底行列が作用する、より一般的な適応的丸め問題を扱う。行列を単純にベクトル化する方法と同じ丸め結果を保ちながら、反対角線ごとの処理で計算量を3次時間に下げる。
続きを読むOmniScope は、音声と映像の関連度が同じタイミングで高まるとは限らない点に着目した、学習不要の Token 圧縮フレームワークです。クエリを共通の意味アンカーにしつつ、各モダリティの重要度を別々に推定します。
続きを読むこの論文は、投機的デコーディングにおける有損検証が、推論効率を高める一方で生成分布を静かに変えてしまう可能性を分析している。速度向上は、品質安定性とのトレードオフとして捉える必要がある。
続きを読む