EditBridge, 원본에 충실한 4K 확산 이미지 편집 제안
EditBridge는 초고해상도 이미지 편집을 위한 확산 브리지 프레임워크다. 저해상도 편집 결과를 별도의 초해상도 모델에 맡기는 대신 원본 고해상도 이미지를 조건으로 사용해 실제 디테일을 보존한다.
더 보기EditBridge는 초고해상도 이미지 편집을 위한 확산 브리지 프레임워크다. 저해상도 편집 결과를 별도의 초해상도 모델에 맡기는 대신 원본 고해상도 이미지를 조건으로 사용해 실제 디테일을 보존한다.
더 보기DiffusionGemma는 텍스트를 한 토큰씩 생성하는 대신 256토큰 블록을 병렬로 반복 보정하는 실험적 오픈웨이트 언어 모델이다. Gemma 4를 미세조정해 만들어졌으며, 생성 속도와 모델 능력 사이의 새로운 절충점을 제시한다.
더 보기이 논문은 텍스트-이미지 생성에서 프롬프트의 길이가 아니라 구조화된 언어 정보가 확산 모델의 학습 손실과 어떤 관계를 갖는지 분석한다. 저자들은 이 관찰을 바탕으로 구조화 프롬프트와 전용 prompter를 설계해 생성 성능을 개선했다.
더 보기Explorative Modeling은 모델 출력과 데이터 사이의 후보 매칭을 여러 개 탐색한 뒤 가장 좋은 후보로 학습하는 방식입니다. 논문은 이 탐색 규모가 파라미터와 데이터에 이은 세 번째 사전학습 스케일링 축이 될 수 있다고 주장합니다.
더 보기Chimera는 고해상도 이미지와 긴 비디오 생성을 위해 전체 어텐션의 계산 비용을 줄이려는 하이브리드 시각 확산 아키텍처다. KDA, MLA, 짧은 합성곱, 희소 MoE, HeteroP 스케일링을 결합한 점이 핵심이다.
더 보기Parallel Decoding Distillation(PDD)은 확산 모델과 플로 매칭 모델의 느린 반복 샘플링을 줄이기 위해 제안된 궤적 기반 증류 방법이다.
더 보기TBSM은 GAN의 판별기나 확산 모델의 고정된 노이즈 제거 경로 대신, 생성 샘플이 실제 데이터 분포로 이동해야 할 방향을 직접 학습하는 접근법입니다.
더 보기소니 연구진은 확산 모델과 플로 매칭 모델의 추론 과정에서 발생하는 주파수 의존적 오차를 보정하는 Spectral Alignment(SPA)를 제안했다. 이 방법은 사전 계산한 스펙트럼 prior와 FFT 기반 가이던스를 이용해 중간 예측을 보정한다.
더 보기이 논문은 확산 언어 모델이 명시적인 타임스텝 없이도 내부에서 디노이징 진행 상태를 추적하는지 분석한다. 연구진은 잔차 스트림에서 시간과 관련된 잠재 신호를 디코딩할 수 있음을 보였다.
더 보기새 논문은 텍스트-이미지 Diffusion Transformer에서 구조적 텍스트 템플릿 토큰이 단순한 자리표시자가 아니라고 주장한다. 이 토큰들은 생성 과정에서 객체 정체성을 유지하는 암묵적 의미 레지스터로 작동한다.
더 보기Mage-Flow는 이미지 생성 모델의 경쟁력이 단순한 파라미터 확대만으로 결정되지 않는다는 점을 보여준다. 4B 규모에서 토크나이저, 확산 Transformer, CUDA 최적화를 함께 설계해 생성과 편집을 모두 겨냥한다.
더 보기DiFA는 확산 모델의 추론 중 생성되는 과거 예측을 단순한 적분 보조값이 아니라 상관된 관측으로 활용하는 재학습 불필요 프레임워크입니다. 전방 확산 과정과 정렬된 시간적 합의를 통해 안정성과 세부 묘사를 높이는 것이 목표입니다.
더 보기DiffGI는 의류처럼 얇은 쉘 구조와 비다양체 표면을 기존 체적 표현이 잘 다루지 못한다는 문제에서 출발합니다. 연속 2D TSDF와 미분 가능한 Marching Squares를 결합해 2D 잠재공간과 3D 표면 최적화를 직접 연결합니다.
더 보기Token Time Continuous Diffusion(TTCD)은 연속 공간에서 동작하며 각 토큰이 서로 다른 속도로 노이즈에서 토큰으로 변하도록 설계된 확산 언어 모델입니다. 특히 고속 생성과 조건부 생성에서의 정확도 개선을 목표로 합니다.
더 보기이 서베이는 이산 확산 모델을 토큰화와 상태공간 설계의 관점에서 다시 정리한다. 텍스트, 단백질, 분자처럼 이산 기호로 된 데이터에서는 토큰 사이의 구조가 곧 모델 설계의 핵심이 된다.
더 보기arXiv 논문은 자율주행 장면의 날씨 편집을 위한 Cyclone 프레임워크를 제안한다. 잠재 확산 모델과 순환 일관성 제약, 이미지-텍스트 모델 지식을 결합해 페어 데이터 없이 다양한 날씨 변환을 수행하는 것이 핵심이다.
더 보기새 arXiv 논문은 무거운 꼬리 분포를 랜덤 클록으로 조건화된 가우시안 혼합으로 표현하는 HTFM을 제안한다. 희귀 사건, 롱테일 이미지, 기상장처럼 극단값이 중요한 데이터에 더 잘 맞는 생성 모델을 목표로 한다.
더 보기TCAM-Diff는 고해상도 3D 의료영상을 조밀한 볼륨 그대로 생성하지 않고, 트라이플레인 표현으로 압축해 확산 모델이 학습하도록 설계된 방법이다. 생성된 특징은 사전 학습된 디코더를 통해 3D 볼륨으로 빠르게 변환된다.
더 보기새 서베이 논문은 이산 확산 모델을 손실 함수나 샘플러가 아니라, 이산 상태 공간을 어떻게 구성하느냐의 문제로 재정의한다.
더 보기