QuadTok、四分木で画像生成向けビジュアルトークン化を再設計
概要
画像生成モデルでは、画像をビジュアルトークンへ変換してからTransformerなどの系列モデルに入力する構成が一般的だ。固定グリッドは扱いやすい一方、空や壁のような均一な領域にも、顔や物体の輪郭のような複雑な領域にも、ほぼ同じ表現予算を割り当てる。QuadTokはこの前提を見直し、画像空間を階層型の四分木として表現する。
複雑な場所に表現容量を配分
QuadTokのTokenizerは、まず画像を粗い領域として扱い、追加の詳細が必要な場所だけを再帰的に分割する。テクスチャや境界が豊かな領域は細かなノードで表し、比較的均一な領域は上位階層にとどめる。これにより、トークンは単なる規則的なパッチではなく、局所的な詳細と空間階層の両方を持つ。
この構造は、二次元グリッドと一次元系列の間にあるトレードオフへの回答でもある。グリッドは近接関係を保ちやすいが、系列モデルでの柔軟な生成とは必ずしも一致しない。一方、一次元化されたトークン列は自回帰モデルに適しているものの、空間的な結び付きを弱める可能性がある。四分木では親子関係によって空間階層を維持しながら、一定の順序で系列として展開できる。
報告された結果
論文概要によると、ImageNetで学習したQuadTokのTokenizerは、固定256トークングリッドと比較して、ImageNetで約10%のトークンを削減した。COCOへゼロショット転移した場合の削減率は約9%で、再構成品質は同程度だったとされる。均一な領域に割り当てられていた冗長な表現の一部を減らせる可能性がある。
生成側では、生成前に与えられた四分木トポロジーを条件として、947MパラメータのGPT型モデルを使用する。ImageNet 256×256ベンチマークでは2.08 gFIDを達成した。また、四分木が保持する空間相関を利用し、ゼロショットの空間制御生成も可能だと報告している。ただし、提供された素材には制御タスクの詳細、比較手法、評価表が含まれていないため、この能力の範囲は論文本文で確認する必要がある。
意義と課題
QuadTokの重要性は、単にトークン数を減らす点だけにない。画像をどのように分割するかを、生成モデルのインターフェースに組み込んだ点にある。トポロジーを大まかな空間的な骨格として先に与え、その後にモデルが異なる領域と階層へ内容を埋めていく構成は、領域編集やレイアウト条件付き生成にもつながり得る。
一方、生成前にトポロジーを用意する必要があり、その予測コストや誤差が結果に影響する可能性がある。可変長の木構造系列は、固定グリッドに比べて学習や推論、バッチ処理を複雑にする可能性もある。さらに、報告結果は主にImageNetとCOCOに基づいており、高解像度や複雑な場面での一般性までは示していない。QuadTokは、すべての領域を均等に扱うのではなく、画像の内容に合わせて視覚トークンを構成する方向を示した研究といえる。
コメント
ログイン状態を確認中…
コメントを読み込み中…