아티클 목록으로
확산 모델

Mage-Flow: 4B 규모 네이티브 해상도 이미지 생성·편집 모델

약 3분 소요

도입

대형 비주얼 생성 모델은 점점 더 강력해지고 있지만, 그만큼 학습과 파인튜닝, 배포 비용도 커지고 있다. Mage-Flow는 이 흐름에 다른 해법을 제시한다. 수십B 파라미터로 바로 확장하기보다, 4B 규모 안에서 토크나이저, 백본, 학습 시스템을 함께 최적화해 효율과 품질을 동시에 노린다. 또한 단순한 텍스트-이미지 생성 모델이 아니라, Mage-Flow-Edit을 통해 지시 기반 이미지 편집까지 같은 기반 위에서 지원한다.

핵심 요점

  • 공유되는 4B 모델 스택: Mage-Flow는 텍스트-이미지 생성, Mage-Flow-Edit은 이미지 편집을 담당한다. 두 모델은 공동 설계된 구성요소를 공유하며 Base, RL-aligned, 4-step Turbo 버전을 제공한다.
  • Mage-VAE로 병목 완화: Mage-VAE는 1단계 확산 방식의 인코딩·디코딩과 anchor-latent 정규화를 사용하는 경량 잠재 토크나이저다. 자료에 따르면 강력한 공개 VAE 수준의 재구성 품질을 유지하면서 토큰화 비용을 한 자릿수 이상 줄인다. 보고서에서는 FLUX.2-VAE 대비 픽셀당 인코딩 MACs는 약 12배, 디코딩 MACs는 약 22배 적다고 설명한다.
  • 네이티브 해상도 처리: NR-MMDiT는 Mage-VAE 잠재 공간에서 rectified flow matching으로 학습된다. 하나의 체크포인트가 512부터 2048까지의 해상도와 다양한 종횡비를 처리하며, 512×2048 또는 2048×512 같은 4:1 비율도 지원한다고 소개된다.
  • 시스템 수준 최적화: native-resolution packing, FlashAttention의 가변 길이 처리, 샘플별 2D RoPE, CUDA 커널 퓨전을 통해 전체 학습 처리량을 약 2.5배 높였다고 한다. CFG의 조건부·무조건부 분기도 하나의 packed forward로 실행할 수 있다.
  • 편집 기능의 확장: Mage-Flow-Edit은 의미적 콘텐츠 수정, 외형 변환, 이미지 복원, 구조 인식 출력 등을 하나의 이미지·텍스트 조건 모델 안에서 다룬다.

의미와 영향

Mage-Flow의 핵심 메시지는 효율이 부가 기능이 아니라 모델 설계의 중심이 될 수 있다는 점이다. 4B급 모델이 훨씬 큰 오픈 모델들과 경쟁 가능한 결과를 낼 수 있다면, 연구팀과 제품팀은 더 낮은 비용으로 파인튜닝과 배포를 시도할 수 있다. 이는 특히 대규모 GPU 자원을 확보하기 어려운 조직에 의미가 크다.

Turbo 버전은 실제 사용성 측면에서 중요하다. 자료에 따르면 단일 A100에서 1024² 해상도 기준 Mage-Flow-Turbo는 이미지당 0.59초, Mage-Flow-Edit-Turbo는 편집당 1.02초를 기록하며, 피크 메모리는 약 18~20GB 수준이다. 고해상도 생성과 편집을 인터랙티브하게 제공하려면 이런 지연시간 단축이 필수적이다.

다만 최종 평가는 공개 가중치, 벤치마크 세부 조건, 독립 재현 결과에 달려 있다. 그럼에도 Mage-Flow는 파라미터 수 경쟁만이 아니라 VAE, 해상도 처리, GPU 실행 스택을 함께 개선하는 실용적 확산 모델 설계로 볼 수 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LLaDA-Image: 생성과 편집을 통합한 오픈 이미지 모델
확산 모델
cctest.ai
확산 모델

LLaDA-Image: 생성과 편집을 통합한 오픈 이미지 모델

LLaDA-Image는 처음부터 학습한 6B 파라미터 DiT와 동결된 비전·언어 이해 모듈을 결합해 이미지 생성과 편집을 지원합니다. 증류된 Turbo 버전은 추론을 2~4 샘플링 단계로 줄이며, 모델 가중치와 코드, 학습 레시피가 함께 공개됩니다.

더 보기
CCTest · Blog
DiffusionGemma: 이산 확산으로 LLM의 순차 생성 병목을 겨냥하다
확산 모델
cctest.ai
확산 모델

DiffusionGemma: 이산 확산으로 LLM의 순차 생성 병목을 겨냥하다

DiffusionGemma는 텍스트를 한 토큰씩 생성하는 대신 256토큰 블록을 병렬로 반복 보정하는 실험적 오픈웨이트 언어 모델이다. Gemma 4를 미세조정해 만들어졌으며, 생성 속도와 모델 능력 사이의 새로운 절충점을 제시한다.

더 보기