HC-DLM, 병렬 확산 생성에서 토큰 의존성을 보존하다
들어가며
확산 언어 모델은 자기회귀 생성의 대안으로 연구되고 있습니다. 정해진 순서에 따라 토큰을 하나씩 생성하는 대신, 노이즈가 있는 전체 시퀀스를 단계적으로 복원할 수 있기 때문입니다. 이런 특성은 양방향 추론이나 전역 제약 충족이 필요한 문제에 유리합니다. 그러나 병렬 생성의 효율성을 유지하면서 동시에 생성되는 토큰 사이의 의존성을 보존하는 일은 여전히 어려운 과제입니다.
일리노이대학교 어배너-섐페인 연구진은 이를 위해 Hierarchical Continuous Diffusion Language Models, 즉 HC-DLM을 제안했습니다. 이 방법은 이산 토큰 생성과 연속 잠재 상태 갱신을 별도의 과정으로 두지 않고 하나의 디노이징 과정 안에서 연결합니다.
핵심 내용
- 이산 확산의 병목: 여러 위치를 병렬로 복원할 때 각 토큰이 자신의 주변 분포에서 독립적으로 샘플링될 수 있습니다. 병렬성은 확보되지만, 함께 생성되는 토큰 사이의 통계적 의존성은 약해질 수 있습니다. 스도쿠나 수학적 계획에서는 이런 문제가 전체 제약을 위반하는 결과로 이어질 수 있습니다.
- 연속 확산의 한계: 공유된 연속 상태를 함께 디노이징하면 위치 간 정보를 보존할 수 있습니다. 하지만 최종적으로 토큰으로 변환되기 전까지는 그 상태가 유효한 이산 토큰 배열과 지속적으로 연결된다는 보장이 약합니다.
- 하나의 지속 상태: HC-DLM은 연속 잠재 변수를 생성 과정 전체에 남는 유일한 상태로 취급합니다. 매 단계에서 잠재 상태로부터 토큰을 읽고, 그 결과를 다음 잠재 상태를 갱신하는 구조적 발판으로 사용합니다.
- 통합 학습 목표: 학습 목표는 토큰 가능도의 변분 하한에서 유도됩니다. 따라서 이산 생성 과정에 연속 정보를 단순히 덧붙이는 대신, 두 구성 요소를 하나의 확률적 틀 안에서 최적화할 수 있습니다.
실험과 의미
논문은 구조적 추론 과제인 스도쿠, 수학적 계획 과제인 Countdown, 언어 모델링 벤치마크인 LM1B에서 HC-DLM을 평가했습니다. 저자들의 보고에 따르면 같은 규모의 모델을 비교했을 때 HC-DLM은 이산 및 연속 확산 기준선보다 스도쿠와 Countdown의 퍼즐 정확도, LM1B의 생성 퍼플렉서티에서 개선을 보였습니다. 제공된 자료에는 구체적인 향상 폭이 없으므로, 이 결과는 모든 설정에서의 보편적 우위라기보다 제안 방식의 가능성을 보여주는 근거로 해석해야 합니다.
이 연구의 핵심은 단순히 연속 표현을 추가한 데 있지 않습니다. 토큰을 마지막 단계에서만 결과로 읽는 것이 아니라, 매 디노이징 단계의 중간 구조 신호로 활용해 다음 잠재 상태에 영향을 주도록 만든 점이 중요합니다. 이 피드백 구조는 전역적 조정 능력과 이산적인 유효성 사이의 간극을 줄이는 경로가 될 수 있습니다.
다만 현재 자료만으로는 자세한 제거 실험, 샘플링 속도, 계산 비용, 대규모 확장성에 대한 판단이 어렵습니다. 향후에는 의존성 보존 효과가 추가 추론 비용을 정당화하는지, 더 큰 모델과 다양한 언어 과제에서도 결과가 유지되는지를 확인해야 합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…