아티클 목록으로
추론·배포

ParaTempo, 시간적 신뢰도로 병렬 추론을 동적으로 최적화

약 3분 소요

대규모 추론 모델은 하나의 사고 경로에만 의존하는 대신 여러 풀이 경로를 병렬로 탐색함으로써 더 안정적인 답을 찾을 수 있습니다. 한 경로가 잘못되더라도 다른 경로가 정답에 도달할 가능성이 남기 때문입니다. 하지만 분기 수가 많아지고 각 경로가 길어질수록 필요한 계산량과 응답 지연도 함께 증가합니다. 병렬 추론을 실제 서비스에 적용하려면 어떤 경로를 계속 실행하고 어떤 경로를 중단할지 판단해야 합니다.

ParaTempo는 이 문제를 해결하기 위해 ‘시간적 신뢰도’를 제안합니다. 이 방법은 별도의 추가 학습 없이 작동하는 비동기 프레임워크입니다. 시스템은 추론 중 각 분기를 주기적으로 탐색해 임시 답안 확률 분포를 얻습니다. 그런 다음 한 시점의 확률이 아니라 최근 여러 탐색 결과가 어떻게 변했는지를 확인합니다. 특정 답안으로 분포가 계속 모이면 해당 분기가 답안 공간에서 수렴하고 있다고 보고 신뢰도를 높입니다. 반대로 예측이 넓게 퍼져 있거나 계속 바뀌면 아직 불확실한 경로로 취급합니다.

이 하나의 신호가 다음과 같은 자원 제어에 사용됩니다.

  • 수렴 조짐이 약한 저신뢰도 분기를 가지치기한다.
  • 지배적인 답안에 지속적으로 수렴하는 분기를 조기에 종료한다.
  • 종료와 가지치기로 확보한 계산을 새 분기를 만드는 데 재할당한다.
  • 신뢰도 가중 투표가 충분히 집중되면 전체 생성을 중단한다.

비동기 구조도 중요한 특징입니다. 모든 추론 경로가 같은 단계까지 진행한 뒤 서로 기다릴 필요가 없습니다. 각 분기는 자신의 수렴 속도에 따라 계속 실행되거나, 종료되거나, 다시 확장될 수 있습니다. 따라서 고정된 분기 수나 미리 정한 추론 길이보다 실제 불확실성에 맞춰 계산을 배분하는 동적 검색에 가깝습니다.

기존의 자기 일관성 방식처럼 여러 답을 끝까지 생성한 뒤 최종 투표만 하는 것과는 차이가 있습니다. 최종 합의는 직관적이지만 판단이 늦고, 아직 진행 중인 경로가 유망한지를 알려주지 못합니다. 토큰 수준의 확률은 즉시 얻을 수 있지만, 실제 추론 진전보다 국소적인 언어 선호를 반영할 수 있습니다. ParaTempo는 여러 시점의 답안 분포를 관찰해 이러한 신호를 분기 수준의 수렴 판단으로 연결하려 합니다.

논문은 수학 및 과학 추론 벤치마크에서 이 프레임워크를 평가했으며 평균 지연 시간이 감소했다고 보고합니다. 다만 제공된 자료에는 구체적인 수치가 없으므로 기준 방법 대비 개선 폭을 단정할 수는 없습니다. 별도 학습 없이 추론 시점의 스케줄링만으로 계산을 조절한다는 점이 핵심적인 실용적 특징입니다.

물론 한계도 있습니다. 여러 분기가 같은 오류를 공유한다면 답안 분포가 한 후보로 집중되어도 정답이라는 보장은 없습니다. 주기적인 탐색 자체에도 추가 비용이 발생하며, 모델과 작업에 따라 신뢰도를 다시 보정해야 할 수 있습니다. 앞으로는 진짜 수렴과 상관된 오답을 구별하고, 신뢰할 수 있는 종료 기준을 설정하는 일이 이 접근법의 실효성을 좌우할 것입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델
추론·배포
cctest.ai
추론·배포

Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델

Daedalus-150M은 대형 모델을 축소한 뒤 CPU에 맞추는 대신, 4비트 가중치와 단일 사용자·토큰 단위 생성을 먼저 정하고 구조를 선택한 소형 언어 모델입니다. 18개 블록 중 12개를 짧은 합성곱으로 구성해 긴 문맥에서 KV 캐시를 반복해서 읽는 비용을 줄였습니다.

더 보기
CCTest · Blog
Llama-Mobile, 2.7비트 양자화로 모바일 VLM 배포에 도전
추론·배포
cctest.ai
추론·배포

Llama-Mobile, 2.7비트 양자화로 모바일 VLM 배포에 도전

Llama-Mobile은 제한된 메모리와 연산 자원을 가진 모바일 기기에서 비전-언어 모델을 실행하기 위한 양자화 프레임워크를 제안합니다. 모델이 직접 생성한 데이터와 Arm CPU 실행을 고려한 2.7비트 형식을 활용해 Llama 3.2 11B Vision Instruct를 3.7GB로 줄이면서 표준 시각 질의응답 성능을 유지했습니다.

더 보기