LLaDA-Image: 생성과 편집을 통합한 오픈 이미지 모델
들어가며
이미지 생성 모델은 이제 그럴듯한 이미지를 만드는 능력뿐 아니라, 세밀한 지시를 이해하고 참조 이미지를 유지하면서 수정하는 능력까지 요구받고 있습니다. 논문 ‘LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes’는 이미지 생성과 편집을 하나의 모델 계열로 통합하는 방법을 제시합니다.
핵심 설계
LLaDA-Image의 중심에는 처음부터 학습한 60억 개 파라미터 규모의 Diffusion Transformer(DiT)가 있습니다. 연구진은 초기부터 이미지·텍스트 쌍 데이터에 크게 의존하기보다, 먼저 이미지 전용 사전 학습과 중간 학습을 진행해 시각 생성 사전 지식을 구축했습니다. 공개된 설명에 따르면 전체 학습 파이프라인에는 약 2억 2,000만 개의 샘플이 포함되며, 실제 이미지 데이터도 포함됩니다.
이해와 조건 부여에는 LLaDA2.0-Mini 확산 언어 모델을 기반으로 한 비전·언어 모듈이 사용됩니다. 이 모듈은 동결된 상태로 유지됩니다. 따라서 DiT는 이미지 생성 과정을 담당하고, 동결된 이해 모듈은 텍스트 지시와 멀티모달 조건을 해석하는 역할을 보조합니다. 지원 기능은 텍스트 기반 이미지 생성, VQ 조건 생성, 참조 이미지 편집, 중국어·영어 텍스트 렌더링입니다.
학습 효율을 위한 선택도 눈에 띕니다. DiT 전체에 파라미터가 없는 RMSNorm을 사용하고 Muon 옵티마이저를 결합했습니다. 논문은 이를 대규모 최적화를 효율적이고 확장 가능하게 만드는 방법으로 제시합니다. 또한 단순히 체크포인트만 제공하는 것이 아니라 모델 가중치, 학습 코드, 상세한 학습 레시피를 함께 공개합니다.
두 가지 버전
- LLaDA-Image: 50단계 샘플링으로 고품질 텍스트-이미지 생성과 지시 기반 편집을 수행합니다.
- LLaDA-Image-Turbo: 증류를 거쳐 2~4단계 샘플링으로 빠른 생성과 편집을 지원합니다.
평가와 의미
논문 초록에 따르면 Qwen-Image-Bench 종합 점수는 영어 트랙 53.53, 중국어 트랙 53.38입니다. 두 트랙 모두 오픈소스 모델 가운데 최고 수준의 결과로 보고되었습니다. 특히 생성, 편집, 참조 이미지 제어, 이중언어 텍스트 렌더링을 하나의 모델 계열에 묶었다는 점은 이미지 모델이 단일 기능 중심에서 통합형 시스템으로 이동하고 있음을 보여줍니다.
다만 제공된 자료만으로는 학습 비용, 데이터 라이선스, 기능별 세부 비교를 확인하기 어렵습니다. 따라서 이후에는 공개된 레시피를 통한 재현성 검증과 함께 다양한 해상도, 복잡한 편집, 실제 서비스 환경에서의 안정성 평가가 필요합니다. 그럼에도 가중치뿐 아니라 코드와 학습 절차를 공개한 것은 오픈 이미지 모델 연구의 접근성을 높이는 중요한 시도입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…