아티클 목록으로
추론·배포

HybridInfer, 스마트폰 열 여유를 반영한 LLM 라우팅 제안

약 3분 소요

들어가며

언어 모델을 기기에서 실행하면 사용자 데이터를 외부로 보내지 않고, 오프라인에서도 사용할 수 있으며, 요청별 클라우드 비용도 줄일 수 있습니다. 그러나 HybridInfer 연구는 모바일 추론의 제약이 항상 점진적인 속도 저하로 나타나는 것은 아니라고 설명합니다. Snapdragon 8 Elite를 탑재한 플래그십 기기에서는 온디바이스 생성을 계속할 때 GPU 추론 런타임이 불안정해져 충돌하거나 사실상 멈추는 현상이 나타났습니다.

따라서 온디바이스·엣지·클라우드 모델을 연결하는 라우터는 품질, 지연시간, 비용뿐 아니라 스마트폰에 남아 있는 열 여유도 판단해야 합니다.

세 계층을 선택하는 방식

HybridInfer는 온디바이스에 Llama 3.2 3B, 엣지에 검색 기능을 갖춘 Llama 3.1 8B, 클라우드에 GPT-4o를 배치합니다. 라우터는 스마트폰의 열 여유와 질의 복잡도 추정치를 상태로 삼고, 오프라인에서 학습한 Q-learning 정책으로 각 요청의 실행 위치를 결정합니다.

보상 함수는 응답 품질, 지연시간, 비용, 열 위험을 함께 반영합니다. 여기에 온디바이스 실행에 대한 로컬성 보너스도 추가했습니다. 이 보너스는 부가적인 장치가 아닙니다. 보너스가 없으면 정책은 기기 부담을 피하기 위해 모든 요청을 외부로 오프로딩하는 방향으로 수렴합니다. 그렇게 되면 온디바이스 추론의 개인정보 보호, 오프라인 사용, 비용 절감이라는 장점이 사라집니다.

실제 기기에서 확인한 결과

평가는 Samsung Galaxy S25+의 안드로이드 측정 환경에서 210개 프롬프트와 고정된 기준 답변을 사용해 진행됐습니다. 손으로 조정한 두 가지 휴리스틱과 비교했을 때 HybridInfer는 유의미하게 더 높은 품질을 보였으며, 대응표본 Wilcoxon 검정에서 p < 0.02가 보고됐습니다. 적응형 조건 가운데 비용도 가장 낮았습니다.

다만 온디바이스 모델이 모든 상황에서 더 낫다는 의미는 아닙니다. 기기에서 처리 가능한 요청만 보면 항상 온디바이스로 실행하는 방식도 요청별 품질은 비슷했습니다. 하지만 속도가 3~6배 느렸고, 긴 요청에서는 실패했습니다. HybridInfer의 강점은 소형 모델 자체의 품질을 높이는 것이 아니라 지연시간, 신뢰성, 처리 범위를 개선하는 데 있습니다.

의미와 한계

이 연구는 열 상태를 별도의 하드웨어 모니터링 정보가 아니라 추론 정책의 입력으로 다룹니다. 모바일 AI 서비스는 앞으로 모델 능력뿐 아니라 기기 상태, 런타임 안정성, 개인정보 선호, 비용을 함께 고려해야 할 수 있습니다.

현재 결과는 한 종류의 스마트폰, 210개 프롬프트, 특정한 세 계층 모델 구성에 기반합니다. 칩셋, 온도 제어 방식, 런타임, 작업 부하가 달라지면 결과도 달라질 수 있습니다. 그럼에도 안드로이드 측정 도구와 전체 라우팅·평가 파이프라인을 공개한 점은 다른 기기에서의 재현과 확장에 도움이 됩니다.

온디바이스 AI의 현실적인 방향은 모든 요청을 무조건 로컬에 두는 것이 아닐 수 있습니다. 언제 로컬 실행을 유지하고, 언제 엣지나 클라우드에 잠시 맡길지 판단하는 능력이 장시간 사용성을 좌우할 가능성이 큽니다.

arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SSD를 ‘메모리 계층’으로 쓰는 Colibrì, 거대 MoE 모델을 일반 PC에서 실행
추론·배포
cctest.ai
추론·배포

SSD를 ‘메모리 계층’으로 쓰는 Colibrì, 거대 MoE 모델을 일반 PC에서 실행

오픈소스 프로젝트 Colibrì는 MoE 모델의 전문가 가중치를 NVMe SSD에 저장하고, 현재 필요한 부분만 RAM이나 VRAM으로 불러옵니다. 메모리 장벽은 낮추지만 SSD 대역폭과 캐시 적중률이 속도를 좌우합니다.

더 보기