아티클 목록으로
확산 모델

LLaDA-Image: 생성과 편집을 통합한 오픈 이미지 모델

약 3분 소요

들어가며

이미지 생성 모델은 이제 그럴듯한 이미지를 만드는 능력뿐 아니라, 세밀한 지시를 이해하고 참조 이미지를 유지하면서 수정하는 능력까지 요구받고 있습니다. 논문 ‘LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes’는 이미지 생성과 편집을 하나의 모델 계열로 통합하는 방법을 제시합니다.

핵심 설계

LLaDA-Image의 중심에는 처음부터 학습한 60억 개 파라미터 규모의 Diffusion Transformer(DiT)가 있습니다. 연구진은 초기부터 이미지·텍스트 쌍 데이터에 크게 의존하기보다, 먼저 이미지 전용 사전 학습과 중간 학습을 진행해 시각 생성 사전 지식을 구축했습니다. 공개된 설명에 따르면 전체 학습 파이프라인에는 약 2억 2,000만 개의 샘플이 포함되며, 실제 이미지 데이터도 포함됩니다.

이해와 조건 부여에는 LLaDA2.0-Mini 확산 언어 모델을 기반으로 한 비전·언어 모듈이 사용됩니다. 이 모듈은 동결된 상태로 유지됩니다. 따라서 DiT는 이미지 생성 과정을 담당하고, 동결된 이해 모듈은 텍스트 지시와 멀티모달 조건을 해석하는 역할을 보조합니다. 지원 기능은 텍스트 기반 이미지 생성, VQ 조건 생성, 참조 이미지 편집, 중국어·영어 텍스트 렌더링입니다.

학습 효율을 위한 선택도 눈에 띕니다. DiT 전체에 파라미터가 없는 RMSNorm을 사용하고 Muon 옵티마이저를 결합했습니다. 논문은 이를 대규모 최적화를 효율적이고 확장 가능하게 만드는 방법으로 제시합니다. 또한 단순히 체크포인트만 제공하는 것이 아니라 모델 가중치, 학습 코드, 상세한 학습 레시피를 함께 공개합니다.

두 가지 버전

  • LLaDA-Image: 50단계 샘플링으로 고품질 텍스트-이미지 생성과 지시 기반 편집을 수행합니다.
  • LLaDA-Image-Turbo: 증류를 거쳐 2~4단계 샘플링으로 빠른 생성과 편집을 지원합니다.

평가와 의미

논문 초록에 따르면 Qwen-Image-Bench 종합 점수는 영어 트랙 53.53, 중국어 트랙 53.38입니다. 두 트랙 모두 오픈소스 모델 가운데 최고 수준의 결과로 보고되었습니다. 특히 생성, 편집, 참조 이미지 제어, 이중언어 텍스트 렌더링을 하나의 모델 계열에 묶었다는 점은 이미지 모델이 단일 기능 중심에서 통합형 시스템으로 이동하고 있음을 보여줍니다.

다만 제공된 자료만으로는 학습 비용, 데이터 라이선스, 기능별 세부 비교를 확인하기 어렵습니다. 따라서 이후에는 공개된 레시피를 통한 재현성 검증과 함께 다양한 해상도, 복잡한 편집, 실제 서비스 환경에서의 안정성 평가가 필요합니다. 그럼에도 가중치뿐 아니라 코드와 학습 절차를 공개한 것은 오픈 이미지 모델 연구의 접근성을 높이는 중요한 시도입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
DiffusionGemma: 이산 확산으로 LLM의 순차 생성 병목을 겨냥하다
확산 모델
cctest.ai
확산 모델

DiffusionGemma: 이산 확산으로 LLM의 순차 생성 병목을 겨냥하다

DiffusionGemma는 텍스트를 한 토큰씩 생성하는 대신 256토큰 블록을 병렬로 반복 보정하는 실험적 오픈웨이트 언어 모델이다. Gemma 4를 미세조정해 만들어졌으며, 생성 속도와 모델 능력 사이의 새로운 절충점을 제시한다.

더 보기
CCTest · Blog
시각 생성에서 텍스트 조건은 어떻게 스케일링되는가
확산 모델
cctest.ai
확산 모델

시각 생성에서 텍스트 조건은 어떻게 스케일링되는가

이 논문은 텍스트-이미지 생성에서 프롬프트의 길이가 아니라 구조화된 언어 정보가 확산 모델의 학습 손실과 어떤 관계를 갖는지 분석한다. 저자들은 이 관찰을 바탕으로 구조화 프롬프트와 전용 prompter를 설계해 생성 성능을 개선했다.

더 보기