FreeToken、コンシューマーGPU向けMoE推論を再設計
バークリー校とMITの研究者が、システムメモリとGPUの間でMoEの専門家重みを効率的に移動させるオープンソース推論エンジンFreeTokenを公開した。論文のベンチマークでは、RTX 4060搭載ノートPCでQwen3.6-35Bが毎秒約39トークンに達したとされる。
続きを読むバークリー校とMITの研究者が、システムメモリとGPUの間でMoEの専門家重みを効率的に移動させるオープンソース推論エンジンFreeTokenを公開した。論文のベンチマークでは、RTX 4060搭載ノートPCでQwen3.6-35Bが毎秒約39トークンに達したとされる。
続きを読むハイブリッド27B言語モデルを用いた実験が、再帰型のGated DeltaNetを8ビット以上で保護するという従来の前提を見直した。全496個の線形層をNVFP4 W4A4で量子化しても、複数の評価でBF16に近い結果を保った。
続きを読むCerebrasの公開推論エンドポイントで、Qwen 3.8 27Bが利用可能になった。無料トライアルと従量課金の両方に対応し、文書では約1500 tokens/sの速度が示されている。
続きを読むNVIDIAが、家庭内ネットワークにある対応PCを接続し、ローカルAI推論に活用するオープンソースソフトウェア「Personal AI Router(PAIR)」を公開した。名前に反して、物理的なルーターではない。
続きを読むCRISPは、入力に応じて変化する疎な注意機構のために、注意マップを直接読む構造指標と、sinkを考慮した閾値を提案します。動的ルーティングの計算負荷と、長い文脈で増える背景ノイズの双方を抑えることが狙いです。
続きを読むDeclarative Attentionは、長いコンテキストのどの領域が必要かをモデル自身に宣言させ、KVキャッシュの読み出しを省く仕組みです。評価では大幅な読み出し削減が示された一方、精度には小さな低下が生じました。
続きを読む200以上の社内アプリケーションのトラフィックを、1つの自社運用モデルに集約するポストトレーニング手法が報告された。指示追従、関数呼び出し、社内タスク分布ごとにGRPO専門家を学習し、2段階SLERPで統合する。
続きを読むNAVER AI Labは、投機的デコードの逐次検証を草稿モデルの学習に組み込むVerification-Aware Training(VAT)を提案した。モデル構造や推論手順を変更せず、受理されるトークン列の長さと実測速度の改善を狙う。
続きを読むvLLM-Omniは、MiniMax H3をエンコーダーからMP4生成までのシステム全体として最適化した。さらにFastVideoのFastH3を組み合わせ、DiTの前向き計算を4回に削減することで、完全な応答を再生時間に近づけている。
続きを読む複数のモデルとタスクを比較した研究で、アテンションシンクを備えたスライディングウィンドウ注意機構が、追加のポストトレーニングなしで、改造された線形注意機構と同等以上の性能を示しました。長文脈推論では差がさらに大きくなっています。
続きを読むLLMの出力射影とTop-k選択を最大内積検索として捉え直し、HNSWベースのベクトルインデックスで候補トークンだけを取得する研究が示された。小バッチのCPU推論におけるメモリ帯域ボトルネックの緩和を狙う。
続きを読む長文脈の実験では、モデルの重みとGPUが同じでも、注意機構のバックエンド、KVキャッシュ、量子化、マルチGPU通信が次のTokenを変えうることが示された。
続きを読むTileMixは、融合された密な注意機構カーネルの中で、スコアタイルごとにFP16とINT8を使い分けます。トークン間の接続を削らず、長文脈プリフィルの精度とスループットの両立を目指します。
続きを読む構造的圧縮と4ビット量子化を重ねると、推論や数学、コーディング、長文脈の性能が低下しやすい。Multiverse Computingは、元の非圧縮モデルから直接蒸留するQuantization-Aware Healing(QAH)を提案した。
続きを読むMultiverse Computingは、構造圧縮と4ビット量子化を受けたモデルを、圧縮前の大規模モデルから直接蒸留するQAHを発表しました。GPT-OSSを使った実験では、60BのMXFP4モデルが9指標中7指標で同じ構成のBF16版を上回りました。
続きを読むDaedalus-150M は、大規模モデルを縮小してから CPU に載せるのではなく、4bit重み・単一ユーザー・逐次デコードという運用条件から逆算して設計された小型言語モデルです。18ブロックのうち12ブロックを短い畳み込みに置き換え、長いコンテキストでの KV キャッシュ読み出しを抑えます。
続きを読むParaTempo は、各推論ブランチが時間とともにどれだけ答えの候補へ収束するかを測る、学習不要の非同期並列推論フレームワークです。信頼度に応じて枝刈りや早期終了、新しいブランチへの計算資源の再配分を行います。
続きを読むNexus は、MCP エージェントが毎ターンすべてのツールスキーマを再エンコードする問題を、検索ベースのルーティングによって切り離す。KV キャッシュの連結も試すが、RoPE の位置ずれが適用範囲を制限する。
続きを読むLlama-Mobileは、限られたメモリと計算資源しか持たない端末向けに、視覚言語モデルを量子化するフレームワークを提案します。モデル自身が生成したデータとArm CPUでの実行を意識した2.7ビット形式により、Llama 3.2 11B Vision Instructを3.7 GBまで圧縮し、標準的な視覚質問応答で高い性能を維持しました。
続きを読むvLLMの実践ガイドは、ROCm環境のAMD Instinct GPUで投機的デコーディングを使う方法を解説しています。ネイティブMTP、EAGLE-3、DFlash、DSparkを比較し、実際の効果は受理率とワークロードに左右されると説明します。
続きを読む同じモデルの重みでも、GPU、量子化、推論ランタイム、注意機構のカーネルが違えば出力は変わり得ます。性能低下の原因はモデルではなく、推論スタックにあるのかもしれません。
続きを読む