Mage-Flow: 4B 규모 네이티브 해상도 이미지 생성·편집 모델
도입
대형 비주얼 생성 모델은 점점 더 강력해지고 있지만, 그만큼 학습과 파인튜닝, 배포 비용도 커지고 있다. Mage-Flow는 이 흐름에 다른 해법을 제시한다. 수십B 파라미터로 바로 확장하기보다, 4B 규모 안에서 토크나이저, 백본, 학습 시스템을 함께 최적화해 효율과 품질을 동시에 노린다. 또한 단순한 텍스트-이미지 생성 모델이 아니라, Mage-Flow-Edit을 통해 지시 기반 이미지 편집까지 같은 기반 위에서 지원한다.
핵심 요점
- 공유되는 4B 모델 스택: Mage-Flow는 텍스트-이미지 생성, Mage-Flow-Edit은 이미지 편집을 담당한다. 두 모델은 공동 설계된 구성요소를 공유하며 Base, RL-aligned, 4-step Turbo 버전을 제공한다.
- Mage-VAE로 병목 완화: Mage-VAE는 1단계 확산 방식의 인코딩·디코딩과 anchor-latent 정규화를 사용하는 경량 잠재 토크나이저다. 자료에 따르면 강력한 공개 VAE 수준의 재구성 품질을 유지하면서 토큰화 비용을 한 자릿수 이상 줄인다. 보고서에서는 FLUX.2-VAE 대비 픽셀당 인코딩 MACs는 약 12배, 디코딩 MACs는 약 22배 적다고 설명한다.
- 네이티브 해상도 처리: NR-MMDiT는 Mage-VAE 잠재 공간에서 rectified flow matching으로 학습된다. 하나의 체크포인트가 512부터 2048까지의 해상도와 다양한 종횡비를 처리하며, 512×2048 또는 2048×512 같은 4:1 비율도 지원한다고 소개된다.
- 시스템 수준 최적화: native-resolution packing, FlashAttention의 가변 길이 처리, 샘플별 2D RoPE, CUDA 커널 퓨전을 통해 전체 학습 처리량을 약 2.5배 높였다고 한다. CFG의 조건부·무조건부 분기도 하나의 packed forward로 실행할 수 있다.
- 편집 기능의 확장: Mage-Flow-Edit은 의미적 콘텐츠 수정, 외형 변환, 이미지 복원, 구조 인식 출력 등을 하나의 이미지·텍스트 조건 모델 안에서 다룬다.
의미와 영향
Mage-Flow의 핵심 메시지는 효율이 부가 기능이 아니라 모델 설계의 중심이 될 수 있다는 점이다. 4B급 모델이 훨씬 큰 오픈 모델들과 경쟁 가능한 결과를 낼 수 있다면, 연구팀과 제품팀은 더 낮은 비용으로 파인튜닝과 배포를 시도할 수 있다. 이는 특히 대규모 GPU 자원을 확보하기 어려운 조직에 의미가 크다.
Turbo 버전은 실제 사용성 측면에서 중요하다. 자료에 따르면 단일 A100에서 1024² 해상도 기준 Mage-Flow-Turbo는 이미지당 0.59초, Mage-Flow-Edit-Turbo는 편집당 1.02초를 기록하며, 피크 메모리는 약 18~20GB 수준이다. 고해상도 생성과 편집을 인터랙티브하게 제공하려면 이런 지연시간 단축이 필수적이다.
다만 최종 평가는 공개 가중치, 벤치마크 세부 조건, 독립 재현 결과에 달려 있다. 그럼에도 Mage-Flow는 파라미터 수 경쟁만이 아니라 VAE, 해상도 처리, GPU 실행 스택을 함께 개선하는 실용적 확산 모델 설계로 볼 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…