아티클 목록으로
확산 모델

ALoDLM, 토큰 난도에 따라 계산량을 배분하는 확산 언어 모델

약 3분 소요

확산 언어 모델(DLM)은 자기회귀 모델처럼 토큰을 한 개씩 왼쪽에서 오른쪽으로 생성하는 대신, 여러 위치를 병렬로 예측하면서 부분적으로 가려진 시퀀스를 점진적으로 완성합니다. 이 구조는 생성 지연을 줄일 가능성이 있지만, 비슷한 규모의 자기회귀 모델에 비해 품질이 낮다는 문제가 실용화를 가로막아 왔습니다.

논문 ‘ALoDLM: Adaptively Looped Diffusion Language Models’는 그 원인 중 하나로 토큰 난도와 계산량의 불일치를 지적합니다. 부분적으로 관측된 시퀀스에는 쉽게 예측되는 미확정 토큰과 더 많은 연산이 필요한 토큰이 함께 존재합니다. 그러나 기존 DLM은 각 디노이징 단계에서 모든 미확정 위치에 비슷한 계산 깊이를 적용하는 경우가 많습니다. 쉬운 토큰에는 필요 이상의 계산을 쓰고, 어려운 토큰은 충분히 정제되기 전에 결정할 수 있다는 의미입니다.

토큰 적응형 잠재 재귀

ALoDLM의 핵심은 토큰별로 계산 경로를 조절하는 잠재 재귀입니다. 각 디노이징 단계에서 모델은 잠재 표현을 반복적으로 갱신합니다. 충분히 확신할 수 있는 위치는 이산 토큰으로 확정하고, 이후 예측에 사용할 수 있는 명시적 문맥으로 다시 모델에 입력합니다. 반대로 아직 해결되지 않은 위치는 잠재 상태를 유지하면서 추가 재귀 패스를 거칩니다.

이 방식에서는 전체 시퀀스가 반드시 같은 횟수만큼 계산될 필요가 없습니다. 여러 위치를 동시에 처리하는 확산 모델의 장점은 유지하면서, 더 많은 연산이 필요한 토큰에 계산을 집중할 수 있습니다. 이는 모든 위치를 같은 속도로 처리하는 방식에서 벗어난 설계입니다.

예측과 계산 배분을 함께 학습

토큰을 예측하는 것만으로는 충분하지 않습니다. 모델은 각 위치에 얼마나 많은 계산을 할지, 그리고 언제 확정할지도 배워야 합니다. 연구진은 토큰별 계산 일정을 잠재변수로 정의하고, 토큰 예측과 계산 배분을 공동 학습하기 위한 조건부 음의 증거 하한(NELBO)을 도출했습니다. 따라서 계산 깊이는 사람이 고정한 추론 설정에만 머무르지 않고, 모델이 학습하는 행동의 일부가 됩니다.

ALoDLM은 1.7B와 8B 파라미터 규모에서 학습되었습니다. 논문에 따르면 11개 벤치마크에서 두 규모 모두 평가된 DLM과 대응하는 자기회귀 기준선보다 높은 평균 벤치마크 점수를 기록했습니다. 또한 병렬 디코딩을 유지했으며, 최적화된 추론 엔진을 사용할 경우 평가된 자기회귀 모델 및 확산 모델 사이에서 품질과 효율의 균형도 강하게 나타났다고 설명합니다.

의미와 남은 질문

ALoDLM이 제시하는 방향은 확산 모델의 병렬성과 위치별 차등 계산이 양립할 수 있다는 점입니다. 모든 토큰을 동일한 경로로 처리하는 대신, 아직 불확실한 토큰에 추가 계산을 할당하면 자기회귀 모델과의 품질 격차를 줄일 가능성이 있습니다. 이는 확산 언어 모델의 장점인 병렬 생성을 포기하지 않고 계산을 더 정교하게 사용하는 접근입니다.

다만 제공된 자료에는 벤치마크별 점수, 구체적인 지연 시간, 계산 일정에 대한 세부 소거 실험이 포함되어 있지 않습니다. 따라서 작업 유형, 시퀀스 길이, 하드웨어가 달라질 때도 효과가 유지되는지는 전체 논문과 추가 실험을 통해 확인해야 합니다. 그럼에도 토큰 단위로 계산을 배분한다는 발상은 확산 언어 모델의 품질과 효율을 동시에 개선하려는 분명한 연구 방향을 보여줍니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
IDU, 생성 모델의 1단계 증류와 선택적 데이터 삭제를 결합
확산 모델
cctest.ai
확산 모델

IDU, 생성 모델의 1단계 증류와 선택적 데이터 삭제를 결합

Inverse Distillation Unlearning(IDU)은 확산 모델이나 플로 매칭 모델을 1단계 생성기로 증류하면서, 지정한 학습 데이터 부분집합에 해당하는 출력을 억제하는 방법이다. 전체 데이터로 학습한 교사 모델과 삭제 대상 샘플만 필요하다.

더 보기
CCTest · Blog
HC-DLM, 병렬 확산 생성에서 토큰 의존성을 보존하다
확산 모델
cctest.ai
확산 모델

HC-DLM, 병렬 확산 생성에서 토큰 의존성을 보존하다

HC-DLM은 이산 토큰 출력과 지속적인 연속 잠재 상태를 결합해 병렬 확산 디코딩에서 끊기기 쉬운 토큰 간 의존성을 다루는 방법입니다. 논문은 스도쿠, Countdown, LM1B에서 같은 규모의 이산·연속 확산 기준선보다 나은 결과를 보고합니다.

더 보기