아티클 목록으로
확산 모델

HC-DLM, 병렬 확산 생성에서 토큰 의존성을 보존하다

약 3분 소요

들어가며

확산 언어 모델은 자기회귀 생성의 대안으로 연구되고 있습니다. 정해진 순서에 따라 토큰을 하나씩 생성하는 대신, 노이즈가 있는 전체 시퀀스를 단계적으로 복원할 수 있기 때문입니다. 이런 특성은 양방향 추론이나 전역 제약 충족이 필요한 문제에 유리합니다. 그러나 병렬 생성의 효율성을 유지하면서 동시에 생성되는 토큰 사이의 의존성을 보존하는 일은 여전히 어려운 과제입니다.

일리노이대학교 어배너-섐페인 연구진은 이를 위해 Hierarchical Continuous Diffusion Language Models, 즉 HC-DLM을 제안했습니다. 이 방법은 이산 토큰 생성과 연속 잠재 상태 갱신을 별도의 과정으로 두지 않고 하나의 디노이징 과정 안에서 연결합니다.

핵심 내용

  • 이산 확산의 병목: 여러 위치를 병렬로 복원할 때 각 토큰이 자신의 주변 분포에서 독립적으로 샘플링될 수 있습니다. 병렬성은 확보되지만, 함께 생성되는 토큰 사이의 통계적 의존성은 약해질 수 있습니다. 스도쿠나 수학적 계획에서는 이런 문제가 전체 제약을 위반하는 결과로 이어질 수 있습니다.
  • 연속 확산의 한계: 공유된 연속 상태를 함께 디노이징하면 위치 간 정보를 보존할 수 있습니다. 하지만 최종적으로 토큰으로 변환되기 전까지는 그 상태가 유효한 이산 토큰 배열과 지속적으로 연결된다는 보장이 약합니다.
  • 하나의 지속 상태: HC-DLM은 연속 잠재 변수를 생성 과정 전체에 남는 유일한 상태로 취급합니다. 매 단계에서 잠재 상태로부터 토큰을 읽고, 그 결과를 다음 잠재 상태를 갱신하는 구조적 발판으로 사용합니다.
  • 통합 학습 목표: 학습 목표는 토큰 가능도의 변분 하한에서 유도됩니다. 따라서 이산 생성 과정에 연속 정보를 단순히 덧붙이는 대신, 두 구성 요소를 하나의 확률적 틀 안에서 최적화할 수 있습니다.

실험과 의미

논문은 구조적 추론 과제인 스도쿠, 수학적 계획 과제인 Countdown, 언어 모델링 벤치마크인 LM1B에서 HC-DLM을 평가했습니다. 저자들의 보고에 따르면 같은 규모의 모델을 비교했을 때 HC-DLM은 이산 및 연속 확산 기준선보다 스도쿠와 Countdown의 퍼즐 정확도, LM1B의 생성 퍼플렉서티에서 개선을 보였습니다. 제공된 자료에는 구체적인 향상 폭이 없으므로, 이 결과는 모든 설정에서의 보편적 우위라기보다 제안 방식의 가능성을 보여주는 근거로 해석해야 합니다.

이 연구의 핵심은 단순히 연속 표현을 추가한 데 있지 않습니다. 토큰을 마지막 단계에서만 결과로 읽는 것이 아니라, 매 디노이징 단계의 중간 구조 신호로 활용해 다음 잠재 상태에 영향을 주도록 만든 점이 중요합니다. 이 피드백 구조는 전역적 조정 능력과 이산적인 유효성 사이의 간극을 줄이는 경로가 될 수 있습니다.

다만 현재 자료만으로는 자세한 제거 실험, 샘플링 속도, 계산 비용, 대규모 확장성에 대한 판단이 어렵습니다. 향후에는 의존성 보존 효과가 추가 추론 비용을 정당화하는지, 더 큰 모델과 다양한 언어 과제에서도 결과가 유지되는지를 확인해야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
고정 상태 캐시가 Block Diffusion의 장거리 추론을 여는 방식
확산 모델
cctest.ai
확산 모델

고정 상태 캐시가 Block Diffusion의 장거리 추론을 여는 방식

3B 파라미터 block diffusion 모델을 비교한 연구에서 상태공간 시퀀스 믹서가 정확하면서도 크기가 일정한 캐시를 제공할 수 있다는 결과가 나왔다. 긴 컨텍스트에서 Mamba는 어텐션보다 메모리와 지연 시간, 처리량 면에서 큰 이점을 보였다.

더 보기
CCTest · Blog
LLaDA-Image: 생성과 편집을 통합한 오픈 이미지 모델
확산 모델
cctest.ai
확산 모델

LLaDA-Image: 생성과 편집을 통합한 오픈 이미지 모델

LLaDA-Image는 처음부터 학습한 6B 파라미터 DiT와 동결된 비전·언어 이해 모듈을 결합해 이미지 생성과 편집을 지원합니다. 증류된 Turbo 버전은 추론을 2~4 샘플링 단계로 줄이며, 모델 가중치와 코드, 학습 레시피가 함께 공개됩니다.

더 보기