LatentPort、KVキャッシュを超えたモデル間メモリ引き継ぎを検証
導入
ある言語モデルから別のモデルへ処理を切り替えるとき、一般的には受け手が過去のコンテキストを最初から読み直すか、送信側が作った注意機構の KV キャッシュを渡す。しかし前者は再計算を招き、後者はハイブリッドモデルの再帰モジュールが蓄積した情報を十分に表せない可能性がある。LatentPort は、モデルが保持する複数の実行状態をまとめて引き継ぎ、受け手が履歴トークンを再処理せずに続きから推論できるかを調べた。
実験の内容
研究対象は、構造を合わせた Qwen3.5 4B と 9B の Base モデルである。まず 4B が 4,096 トークンのコンテキストを処理し、その後、9B へ変換済みの注意機構 KV、Gated DeltaNet(GDN)の再帰状態、畳み込みモジュールの状態を渡す。9B は過去のプレフィックスを1トークンも受け取らず、後続部分だけを処理する。
主な結果は次の通りだ。
- KV だけを変換する方法では、ネイティブ 9B との性能差が大きく残った。
- GDN の持続状態を加えると、教師強制の負の対数尤度が平均 0.747 nats/token 改善した。95%の文書ペア・ブートストラップ信頼区間は 0.6921–0.8047 で、PG19 の64文書すべてで改善が見られた。
- 再帰状態と畳み込み状態を直接再利用する方法は、今回試した学習型 GDN 変換を上回った。異なるサイズのモデル間でも、状態座標の一部が機能的に互換である可能性を示す。
- さらに 434,176 パラメータの補正を加えると、64件の新しいウェブ文書で、ネイティブ 9B より高い継続損失は 0.076 nats/token、JS ダイバージェンスは 0.022、ネイティブ文脈回復指標は 0.918 となった。
補正後の 9B は、4B の推論をそのまま継続する方法も有意に上回った。それでも、過去のプレフィックスを処理していない点がこの結果の重要なところである。
意義と限界
LatentPort のポイントは、転送対象を KV キャッシュだけに限定しないことだ。ハイブリッドモデルでは、文脈の一部が注意機構だけでなく、再帰状態や畳み込み状態にも保持される。将来的にこうした状態を受け渡すインターフェースが整えば、モデルの動的な切り替え、カスケード推論、長文推論サービスの再計算削減、多モデル協調などに応用できる可能性がある。
ただし、これは汎用的なモデル間メモリ規格の実証ではない。検証は一方向、1つの構造整合モデル対、4Kの教師強制継続に限られる。ネイティブに近いゲート分岐は失敗し、16K分岐は実行されていない。また、自由生成で同等の挙動になることも示されていない。異なるアーキテクチャや学習世代への転送の安定性、内部状態を越境させる際の安全性とプライバシーも、今後の課題として残る。
コメント
ログイン状態を確認中…
コメントを読み込み中…