QuadTok:用四叉树重构图像自回归生成的视觉分词方式
导语
视觉生成模型通常需要先把图像转换为令牌,再交给Transformer或其他序列模型处理。固定网格方案实现简单,却会给整张图像分配近似均匀的表示预算:天空、墙面等单调区域与人脸、物体边缘等复杂区域,往往使用相同数量的令牌。QuadTok的核心思路,是用四叉树把二维空间组织成可逐级细分的层次结构,让视觉分词过程更贴近图像本身的内容分布。
核心方法:让令牌跟随视觉复杂度变化
QuadTok首先以较粗的区域表示图像,并对需要更多细节的区域继续划分。纹理、边界或局部结构较丰富的位置,可以获得更细的节点;相对均匀的区域则停留在较高层级。这样,令牌不再只是规则网格中的固定切片,而是同时携带空间层次和局部细节信息。
这一设计试图连接两种常见表示方式:二维网格能够保留空间邻接关系,但序列建模的灵活性有限;一维令牌序列适合自回归模型,却容易削弱原始空间结构。四叉树通过父子节点关系保留了区域之间的空间绑定,同时可以按照一定顺序展开为序列,供自回归模型预测。
实验结果
根据论文摘要,QuadTok在ImageNet上训练的Tokenizer,相比固定的256令牌网格,令牌数量约减少10%;在零样本迁移到COCO时,节省比例约为9%。在重建质量保持相近的前提下,这说明动态分配表示容量可能减少部分冗余。
在生成端,研究团队使用一个947M参数的GPT式模型,并在生成前提供四叉树拓扑。该模型在ImageNet 256×256基准上取得2.08 gFID。论文还指出,由于四叉树保留了较强的空间相关性,QuadTok生成器能够实现零样本空间控制生成。不过,现有素材没有给出控制任务的具体设置、对比方法或更完整的评测表,因此这一能力仍应结合论文全文进一步判断。
意义与限制
QuadTok的价值不只是减少令牌数量,更在于把“图像如何被切分”纳入生成建模过程。对于自回归图像生成而言,拓扑先于内容提供了一种明确的空间骨架,模型随后可以在不同区域和层级上填充视觉信息。这种表示或许有助于在计算预算有限时优先保留重要细节,也为区域级编辑、布局控制等方向提供接口。
但该方案也带来新的问题:生成前需要获得或设定四叉树拓扑,拓扑预测本身的成本和误差会影响最终效果;动态序列的长度与遍历方式,也可能增加训练和推理实现的复杂度。此外,摘要中的结果主要集中于ImageNet和COCO,尚不足以证明其在更高分辨率、更复杂场景或不同生成任务上的普适性。总体来看,QuadTok提供了一条从固定网格走向内容自适应视觉令牌的清晰路径。
评论
正在确认登录状态……
正在加载评论……