QuadTok, 쿼드트리로 이미지 생성용 비주얼 토큰화를 재구성하다
개요
이미지 생성 시스템은 대개 이미지를 비주얼 토큰으로 변환한 뒤 Transformer와 같은 시퀀스 모델에 입력한다. 고정 그리드는 구현이 간단하지만, 하늘이나 벽처럼 단순한 영역과 얼굴·물체 경계처럼 복잡한 영역에 비슷한 표현 예산을 배정한다. QuadTok은 이 문제를 이미지 공간을 계층형 쿼드트리로 구성하는 방식으로 해결하려 한다.
시각적 복잡도에 따른 토큰 배분
QuadTok 토크나이저는 먼저 이미지를 거친 영역으로 표현한 뒤, 더 많은 세부 정보가 필요한 부분만 재귀적으로 세분화한다. 질감이나 경계가 풍부한 곳은 더 작은 노드로 표현하고, 비교적 균일한 곳은 상위 수준에 남긴다. 따라서 토큰은 단순한 규칙형 패치가 아니라 국소적인 세부 정보와 공간적 계층 관계를 함께 담게 된다.
이 방식은 2차원 그리드와 1차원 시퀀스의 장점을 결합하려는 시도다. 그리드는 인접 영역과 공간적 결합을 보존하기 쉽지만, 시퀀스 기반 자기회귀 모델과 바로 맞물리지는 않는다. 반대로 1차원 토큰열은 GPT형 모델에 적합하지만 원래 이미지의 공간 구조를 약화시킬 수 있다. 쿼드트리는 부모와 자식 노드 관계를 통해 계층적 공간 정보를 유지하면서, 정해진 순서에 따라 시퀀스로 펼칠 수 있다.
보고된 실험 결과
논문 요약에 따르면 ImageNet으로 학습한 QuadTok 토크나이저는 고정 256토큰 그리드와 비교해 ImageNet에서 약 10%의 토큰을 절약했다. COCO에 제로샷으로 전이했을 때의 절감 폭은 약 9%였다. 재구성 품질은 비슷한 수준으로 보고되어, 시각적으로 단순한 영역에 배정되던 일부 중복 표현을 줄일 가능성을 보여준다.
생성 단계에서는 생성 전에 제공된 쿼드트리 토폴로지를 조건으로 947M 파라미터 GPT형 모델을 사용한다. 이 모델은 ImageNet 256×256 벤치마크에서 2.08 gFID를 기록했다. 연구진은 쿼드트리 구조가 강한 공간 상관관계를 보존하기 때문에 제로샷 공간 제어 이미지 생성도 가능하다고 설명한다. 다만 제공된 자료에는 제어 작업의 구체적 설정, 비교 기준, 전체 평가표가 포함되어 있지 않으므로 해당 능력의 범위는 원문 확인이 필요하다.
의미와 남은 과제
QuadTok의 의미는 단순히 토큰 수를 줄이는 데 그치지 않는다. 이미지를 어떻게 분할할 것인지 자체를 생성 모델의 인터페이스로 가져왔다는 점이 핵심이다. 쿼드트리 토폴로지를 대략적인 공간 골격으로 먼저 제공하고, 자기회귀 모델이 여러 영역과 계층에 시각적 내용을 채우도록 하는 구조는 영역 편집이나 레이아웃 조건부 생성으로 확장될 여지가 있다.
그러나 생성 전에 토폴로지를 준비해야 하므로 토폴로지 예측 비용과 오류가 최종 품질에 영향을 줄 수 있다. 가변 길이의 트리 시퀀스와 순회 방식은 고정 그리드보다 학습·추론 및 배치 처리를 복잡하게 만들 가능성도 있다. 또한 현재 보고된 결과는 주로 ImageNet과 COCO에 집중되어 있어, 고해상도나 복잡한 장면에서의 일반화까지 입증한 것은 아니다. 그럼에도 QuadTok은 모든 영역을 동일하게 다루는 대신 이미지 내용에 맞춰 비주얼 토큰을 배분하는 명확한 방향을 제시한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…