읽을 수 있는 것만으로는 부족하다: UltraText Bench가 검증한 이미지 생성의 텍스트 정확도
들어가며
이미지 생성 모델이 짧은 단어를 알아볼 수 있게 표현하는 능력은 빠르게 개선되고 있습니다. 하지만 실제 포스터, 메뉴, 상품 포장, 도로 표지판과 같은 장면에는 여러 텍스트 영역이 동시에 존재합니다. 모델은 각 문구를 정확히 재현하면서 올바른 위치에 배치하고, 가독성과 시각적 속성까지 유지해야 합니다. 웨스트레이크대학교 연구팀이 제안한 UltraText Bench는 이러한 밀집 시각 텍스트 생성 능력을 측정하기 위한 이중언어 벤치마크입니다.
핵심 내용
- 이중언어와 다양한 장면: 432개 프롬프트가 24개 실제 장면 범주와 3개 난이도로 구성됩니다. 영어와 중국어를 동일한 비중으로 포함해 특정 언어에 편중되지 않은 비교를 지원합니다.
- 여러 텍스트 영역을 한 번에 평가: 사람이 검토한 각 프롬프트는 4~12개 텍스트 영역의 정확한 문자열을 지정합니다. 텍스트 내용뿐 아니라 위치와 시각적 특성도 구조화된 참조 정보로 제공됩니다.
- 세부 평가 지표: 비전-언어 모델인 Q-Judger를 사용해 텍스트 충실도, 텍스트 명료도, 공간 품질, 장면 품질을 따로 평가합니다. 글자가 선명해 보여도 요청한 문구를 정확히 보존하지 못할 수 있기 때문입니다.
- 선명도와 정확도의 차이: 보고된 설정에서 Z-Image-Turbo는 Z-Image-Base보다 명료도에서 3.81점 높았지만, 충실도에서는 14.76점 낮았습니다. 따라서 시각적 선명도만으로 텍스트 생성 성능을 판단하기 어렵습니다.
- 작업량이 늘면 성능 하락: Qwen-Image-2512의 영어 종합 점수는 L1 난이도의 86.50에서 L3의 42.86으로 떨어졌습니다. 텍스트의 양과 장면 복잡도가 증가하면 짧은 문자열 평가에서 드러나지 않던 약점이 나타납니다.
의미와 영향
UltraText Bench의 의의는 이미지 속 텍스트를 단순히 “읽을 수 있는가”의 문제로 보지 않고, 여러 제약을 동시에 준수해야 하는 실행 과제로 정의했다는 데 있습니다. 실제 디자인 작업에서는 문구, 위치, 정보의 위계, 스타일, 전체 구성을 함께 맞춰야 합니다. 하나의 제목만 확인하는 평가는 모델의 실용성을 지나치게 높게 평가할 수 있습니다.
또한 하나의 총점만으로는 모델의 장단점을 충분히 설명하기 어렵습니다. 어떤 모델은 매우 선명한 글자를 만들지만 중요한 단어나 숫자를 바꿀 수 있습니다. 반대로 요청한 내용은 더 잘 보존하면서도 배치나 가독성이 떨어지는 모델도 있을 수 있습니다. 평가 차원을 분리하면 모델 선택과 학습 데이터 개선에 더 구체적인 근거를 제공할 수 있습니다.
자동 평가의 타당성을 확인하기 위해 10명의 참가자가 사람 평가에도 참여했습니다. 다만 제공된 자료는 벤치마크 설계와 일부 비교 결과를 중심으로 하며, 모든 언어와 응용 분야에서 특정 모델의 절대적 우위를 주장하지는 않습니다. 앞으로 이미지 생성 평가에는 다국어 텍스트, 여러 영역, 긴 문자열, 단계적으로 증가하는 작업량을 포함하는 방식이 더욱 중요해질 것으로 보입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…