LLaDA-Image: 생성과 편집을 통합한 오픈 이미지 모델
LLaDA-Image는 처음부터 학습한 6B 파라미터 DiT와 동결된 비전·언어 이해 모듈을 결합해 이미지 생성과 편집을 지원합니다. 증류된 Turbo 버전은 추론을 2~4 샘플링 단계로 줄이며, 모델 가중치와 코드, 학습 레시피가 함께 공개됩니다.
더 보기LLaDA-Image는 처음부터 학습한 6B 파라미터 DiT와 동결된 비전·언어 이해 모듈을 결합해 이미지 생성과 편집을 지원합니다. 증류된 Turbo 버전은 추론을 2~4 샘플링 단계로 줄이며, 모델 가중치와 코드, 학습 레시피가 함께 공개됩니다.
더 보기EditBridge는 초고해상도 이미지 편집을 위한 확산 브리지 프레임워크다. 저해상도 편집 결과를 별도의 초해상도 모델에 맡기는 대신 원본 고해상도 이미지를 조건으로 사용해 실제 디테일을 보존한다.
더 보기DiffusionGemma는 텍스트를 한 토큰씩 생성하는 대신 256토큰 블록을 병렬로 반복 보정하는 실험적 오픈웨이트 언어 모델이다. Gemma 4를 미세조정해 만들어졌으며, 생성 속도와 모델 능력 사이의 새로운 절충점을 제시한다.
더 보기이 논문은 텍스트-이미지 생성에서 프롬프트의 길이가 아니라 구조화된 언어 정보가 확산 모델의 학습 손실과 어떤 관계를 갖는지 분석한다. 저자들은 이 관찰을 바탕으로 구조화 프롬프트와 전용 prompter를 설계해 생성 성능을 개선했다.
더 보기Explorative Modeling은 모델 출력과 데이터 사이의 후보 매칭을 여러 개 탐색한 뒤 가장 좋은 후보로 학습하는 방식입니다. 논문은 이 탐색 규모가 파라미터와 데이터에 이은 세 번째 사전학습 스케일링 축이 될 수 있다고 주장합니다.
더 보기Chimera는 고해상도 이미지와 긴 비디오 생성을 위해 전체 어텐션의 계산 비용을 줄이려는 하이브리드 시각 확산 아키텍처다. KDA, MLA, 짧은 합성곱, 희소 MoE, HeteroP 스케일링을 결합한 점이 핵심이다.
더 보기Parallel Decoding Distillation(PDD)은 확산 모델과 플로 매칭 모델의 느린 반복 샘플링을 줄이기 위해 제안된 궤적 기반 증류 방법이다.
더 보기TBSM은 GAN의 판별기나 확산 모델의 고정된 노이즈 제거 경로 대신, 생성 샘플이 실제 데이터 분포로 이동해야 할 방향을 직접 학습하는 접근법입니다.
더 보기소니 연구진은 확산 모델과 플로 매칭 모델의 추론 과정에서 발생하는 주파수 의존적 오차를 보정하는 Spectral Alignment(SPA)를 제안했다. 이 방법은 사전 계산한 스펙트럼 prior와 FFT 기반 가이던스를 이용해 중간 예측을 보정한다.
더 보기이 논문은 확산 언어 모델이 명시적인 타임스텝 없이도 내부에서 디노이징 진행 상태를 추적하는지 분석한다. 연구진은 잔차 스트림에서 시간과 관련된 잠재 신호를 디코딩할 수 있음을 보였다.
더 보기새 논문은 텍스트-이미지 Diffusion Transformer에서 구조적 텍스트 템플릿 토큰이 단순한 자리표시자가 아니라고 주장한다. 이 토큰들은 생성 과정에서 객체 정체성을 유지하는 암묵적 의미 레지스터로 작동한다.
더 보기Mage-Flow는 이미지 생성 모델의 경쟁력이 단순한 파라미터 확대만으로 결정되지 않는다는 점을 보여준다. 4B 규모에서 토크나이저, 확산 Transformer, CUDA 최적화를 함께 설계해 생성과 편집을 모두 겨냥한다.
더 보기DiFA는 확산 모델의 추론 중 생성되는 과거 예측을 단순한 적분 보조값이 아니라 상관된 관측으로 활용하는 재학습 불필요 프레임워크입니다. 전방 확산 과정과 정렬된 시간적 합의를 통해 안정성과 세부 묘사를 높이는 것이 목표입니다.
더 보기DiffGI는 의류처럼 얇은 쉘 구조와 비다양체 표면을 기존 체적 표현이 잘 다루지 못한다는 문제에서 출발합니다. 연속 2D TSDF와 미분 가능한 Marching Squares를 결합해 2D 잠재공간과 3D 표면 최적화를 직접 연결합니다.
더 보기Token Time Continuous Diffusion(TTCD)은 연속 공간에서 동작하며 각 토큰이 서로 다른 속도로 노이즈에서 토큰으로 변하도록 설계된 확산 언어 모델입니다. 특히 고속 생성과 조건부 생성에서의 정확도 개선을 목표로 합니다.
더 보기이 서베이는 이산 확산 모델을 토큰화와 상태공간 설계의 관점에서 다시 정리한다. 텍스트, 단백질, 분자처럼 이산 기호로 된 데이터에서는 토큰 사이의 구조가 곧 모델 설계의 핵심이 된다.
더 보기arXiv 논문은 자율주행 장면의 날씨 편집을 위한 Cyclone 프레임워크를 제안한다. 잠재 확산 모델과 순환 일관성 제약, 이미지-텍스트 모델 지식을 결합해 페어 데이터 없이 다양한 날씨 변환을 수행하는 것이 핵심이다.
더 보기새 arXiv 논문은 무거운 꼬리 분포를 랜덤 클록으로 조건화된 가우시안 혼합으로 표현하는 HTFM을 제안한다. 희귀 사건, 롱테일 이미지, 기상장처럼 극단값이 중요한 데이터에 더 잘 맞는 생성 모델을 목표로 한다.
더 보기TCAM-Diff는 고해상도 3D 의료영상을 조밀한 볼륨 그대로 생성하지 않고, 트라이플레인 표현으로 압축해 확산 모델이 학습하도록 설계된 방법이다. 생성된 특징은 사전 학습된 디코더를 통해 3D 볼륨으로 빠르게 변환된다.
더 보기새 서베이 논문은 이산 확산 모델을 손실 함수나 샘플러가 아니라, 이산 상태 공간을 어떻게 구성하느냐의 문제로 재정의한다.
더 보기