DLoop, 추측 디코딩의 타깃 모델 검증을 줄이다
개요
대규모 언어 모델의 자기회귀 생성은 토큰을 생성할 때마다 큰 타깃 모델을 반복 호출해야 하므로 비용이 높습니다. 추측 디코딩은 이 문제를 완화하기 위해 먼저 가벼운 드래프트 모델이 여러 후보 토큰을 제안하고, 이후 타깃 모델이 이를 묶어서 검증하도록 합니다.
하지만 일반적인 추측 디코딩은 ‘한 번 드래프트하고 한 번 검증하는’ 고정된 흐름을 따릅니다. 드래프트 모델이 충분히 강해 한 단계의 모든 토큰이 수용될 가능성이 높아도 검증은 매번 실행됩니다. NAVER AI Lab의 DLoop: Looped Speculative Decoding은 이 낭비를 줄이기 위해 여러 드래프트 단계를 연속 수행한 뒤 누적된 토큰을 한 번에 검증하는 방식을 제안합니다.
핵심 내용
- 확신도에 따라 검증을 지연합니다. 드래프트 모델의 확신도가 충분히 높으면 다음 드래프트 단계를 계속 진행하고, 확신도가 낮아지는 시점에 누적 후보를 타깃 모델로 보내 검증합니다.
- 비싼 타깃 모델 계산을 줄입니다. 추가 작업은 상대적으로 가벼운 드래프트 모델에서 수행하고, 대규모 타깃 모델의 순전파 호출 횟수를 줄이는 구조입니다.
- 병렬 드래프트의 제약을 고려합니다. 자기회귀 드래프트 모델은 시퀀스를 이어 생성하기 쉽지만, 병렬 드래프트 모델은 아직 검증되지 않은 토큰에 필요한 타깃 모델의 은닉 상태가 부족할 수 있습니다.
- loop-aware training을 사용합니다. 학습 과정에서 드래프트 모델이 직접 생성한 미검증 토큰의 은닉 상태를 접하게 해, 추가 반복 단계에서도 모델이 안정적으로 후보를 만들도록 합니다.
- 여러 방법에서 평가했습니다. EAGLE-3, DFlash, Domino, DSpark 및 다중 토큰 예측 모듈을 대상으로 평가했으며, 무손실 디코딩을 유지하면서 5~41%의 벽시계 시간 향상을 보고했습니다.
의미와 영향
DLoop의 핵심은 드래프트 모델 자체를 단순히 키우는 것이 아니라 드래프트와 검증의 실행 순서를 바꾸는 데 있습니다. 드래프트 모델의 수용률이 높아질수록 매 단계 직후 검증하는 방식은 비효율적입니다. DLoop는 신뢰도가 높은 단계들을 연결하고, 타깃 모델의 계산을 검증이 필요한 시점에 집중시킵니다.
다만 검증 횟수를 줄이는 대신 드래프트 모델의 순전파는 추가로 필요합니다. 따라서 전체 속도 향상은 추가 드래프트 비용이 절약되는 타깃 모델 비용보다 낮을 때 실현됩니다. 드래프트 모델의 규모와 확신도 보정, 하드웨어의 병렬 처리 효율, 배치 크기와 시퀀스 길이 등이 실제 성능에 영향을 줄 수 있습니다.
추론 서비스 관점에서 DLoop는 타깃 모델 호출이 지연 시간과 처리량을 크게 좌우하는 환경에 적용할 수 있는 최적화 방향입니다. 특히 병렬 드래프트 모델에서 발생하는 미검증 은닉 상태 문제를 학습 단계부터 다룬다는 점이 중요합니다. 이 연구가 주는 큰 시사점은 분명합니다. 드래프트 모델이 충분히 확신한다면 추측 디코딩은 모든 단계 뒤에 즉시 멈춰 검증할 필요가 없습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…