記事一覧へ戻る
マルチモーダル

V-CoLA:線形アテンション向けの視覚トークン圧縮

読了目安 3 分

導入

視覚言語モデル(VLM)は画像とテキストを統合して扱える一方、画像は多数の視覚トークンへ変換されてからモデルに入力される。その結果、入力列が長くなり、推論時の計算量やメモリ使用量が増加する。視覚情報をできるだけ保ったままトークン数を減らすことは、マルチモーダルモデルを実用化するうえで重要な課題になっている。

「V-CoLA: Vision Token Compression with Linear Attention」は、この課題を線形アテンションの観点から扱う研究だ。従来の視覚トークン圧縮手法には、Softmaxアテンションを前提に設計されたものが多い。しかし、Qwen3.5の例に見られるように、線形アテンションを組み込んだ混合アーキテクチャが登場すると、アテンション値や特徴量の類似度に基づく従来の選別方法をそのまま適用するのは難しくなる。論文の分析では、両方のアプローチで性能低下が確認されたという。

V-CoLAの仕組み

V-CoLAは追加学習を必要としない圧縮フレームワークで、主に次の考え方を組み合わせる。

  • 独自性を考慮した重要度評価:単に目立つトークンや類似度の高いトークンを残すのではなく、他のトークンが持たない情報を含むかどうかを評価する。周辺のトークンと似ていなくても、特定の物体や細部を表す情報は重要になり得る。
  • 適応的なトークン統合:圧縮対象を一律に削除するのではなく、複数のトークンを統合する。これにより、入力列を短縮しながら視覚内容の全体的な情報を残しやすくする。
  • 分割並列処理への対応:線形アテンションで使われるチャンク単位の並列処理を妨げないよう、圧縮処理を実装レベルで最適化する。理論上の削減だけでなく、実際の推論速度も意識した設計である。

報告された結果

複数のベンチマークにおいて、視覚トークンを元の50%にすると、V-CoLAは元モデルの99.5%の性能を達成したと報告されている。さらに12.5%まで削減した場合でも、性能は88%を超えた。プリフィル速度の向上幅は1.86倍から6.15倍だった。

この結果は、視覚トークンの多くが冗長である可能性を示す一方、重要な情報を見つける基準はアテンション方式によって異なることも示唆する。単純な削除ではなく、重複情報と固有情報を区別することが、性能維持につながる。

意義と今後

V-CoLAの意義は、トークン圧縮をモデルのアーキテクチャに依存する問題として捉えた点にある。線形アテンションとSoftmaxアテンションが共存するモデルでは、単一の選別規則をすべての構成に適用するのは難しい。追加学習なしで導入できる点も、既存の推論パイプラインへの応用を考えるうえで利点になる。

一方、提示された概要だけでは、あらゆる視覚エンコーダー、タスク、モデル系列での適用範囲までは判断できない。圧縮率と精度の細かな関係や、異なる構成での安定性には、より詳しい検証が必要だ。それでも本研究は、マルチモーダル推論のプリフィルコストを下げるための有力な方向性を示している。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
OneSearch-VL、証拠グラフで画像・動画の深層リサーチを統合
マルチモーダル
cctest.ai
マルチモーダル

OneSearch-VL、証拠グラフで画像・動画の深層リサーチを統合

OneSearch-VLは、視覚的グラウンディング、外部検索、事実の統合を結び付ける「視覚グラウンデッド証拠グラフ」を提案しました。画像と動画を対象に、学習データ、強化学習報酬、操作別ベンチマークを一体化しています。

続きを読む
CCTest · Blog
OmniConfess、多モーダルモデルが幻覚を生む根拠をトークン単位で追跡
マルチモーダル
cctest.ai
マルチモーダル

OmniConfess、多モーダルモデルが幻覚を生む根拠をトークン単位で追跡

OmniConfessは再学習を必要とせず、テキスト・画像・音声・動画の各証拠チャネルが回答のどのトークンを支えているかを調べ、信頼性の低い主張を修正する推論時手法です。

続きを読む
CCTest · Blog
Kandinsky 6.0 Video、映像・音声・リップシンクを同時生成
マルチモーダル
cctest.ai
マルチモーダル

Kandinsky 6.0 Video、映像・音声・リップシンクを同時生成

Kandinsky 6.0 Videoは、テキストまたは画像から、44 kHz音声とリップシンクを備えた約5秒の動画を生成するモデル群です。動画ストリームと音声ストリームを双方向に接続するCrossDiTにより、映像と音の時間的・意味的な整合を狙います。

続きを読む