아티클 목록으로
음성·오디오

말이 끝나기 전에 도구를 실행하는 음성 에이전트

약 3분 소요

배경

음성 비서의 응답 지연은 음성 인식이나 대규모 언어 모델의 처리 속도만으로 결정되지 않는다. 날씨, 일정, 검색처럼 외부 도구가 필요한 요청에서는 보통 음성 인식이 끝난 뒤 언어 모델이 도구 호출을 결정하고, 그 다음에 도구를 실행한다. 이 구조에서는 사용자가 말을 마친 이후에 도구의 대기 시간이 고스란히 추가된다.

논문 「Hiding Tool Latency in On-Device Cascaded Voice Agent through Speculative Execution」은 이 직렬 구조를 일부 겹쳐 실행하는 방법을 제안한다. 최종 음성 인식 결과를 기다리는 대신, 스트리밍 ASR의 중간 결과를 보고 필요한 도구를 미리 추정해 사용자가 말하는 동안 실행하는 방식이다.

작동 방식

  • 부분 ASR 기반 예측: Predictor 모듈이 계속 갱신되는 중간 텍스트를 관찰하고 도구가 필요한 요청인지 추정한다.
  • 도구 선행 실행과 캐시: 후보 도구 호출이 감지되면 백그라운드에서 실행하고 결과를 저장한다. 사용자가 발화를 끝낸 뒤에는 캐시된 결과를 언어 모델 프롬프트에 넣어 다시 기다리는 시간을 줄인다.
  • 자기 수정 검증: 사용자는 문장 중간에 장소, 시간, 숫자 등의 조건을 바꿀 수 있다. 시스템은 규칙 기반 검증으로 현재 요청과 일치하는 캐시 결과만 선택한다.
  • 기존 경로를 활용한 안전장치: 예측이 틀렸거나 캐시 결과가 유효하지 않으면 언어 모델이 평소처럼 도구를 직접 호출한다. 즉, 추측 실행은 필수 경로가 아니라 지연 시간을 줄이기 위한 최적화다.

측정 결과와 의미

연구진은 완전히 구현된 Android 음성 비서에서 실시간 측정을 진행했다. 첫 오디오 출력까지 걸리는 시간의 중간값은 5.79초에서 4.60초로 감소했다. 표준편차도 3.49초에서 2.81초로 줄어, 일반적인 응답이 빨라졌을 뿐 아니라 대기 시간의 변동성도 낮아졌다.

핵심은 특정 모델의 추론 시간을 단순히 줄이는 데 있지 않다. 음성 인식이 끝나기 전에 도구 실행을 시작해, 원래 순차적으로 발생하던 작업 일부를 겹치는 데 있다. 따라서 전체 시스템을 완전한 엔드투엔드 또는 풀듀플렉스 모델로 교체하지 않고도 기존 ASR, LLM, 도구 연결 구조에 예측기와 캐시 계층을 추가할 수 있다. 온디바이스 음성 비서의 엔지니어링 관점에서 실용적인 이유다.

다만 추측 실행은 잘못된 호출, 불필요한 리소스 사용, 오래된 결과의 처리라는 부담을 만든다. 검증 규칙과 기존 호출 경로가 위험을 낮추지만, 더 많은 도구와 다양한 단말, 네트워크 조건, 발화 수정 패턴에서도 같은 효과가 유지되는지는 추가 평가가 필요하다. 이 연구가 보여주는 방향은 분명하다. 음성 에이전트의 지연 시간은 더 빠른 모델뿐 아니라, 충분히 확실한 작업을 얼마나 일찍 시작하느냐에 의해서도 줄일 수 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
StepAudio 3 Realtime: 말하면서 생각하는 풀 듀플렉스 음성 모델
음성·오디오
cctest.ai
음성·오디오

StepAudio 3 Realtime: 말하면서 생각하는 풀 듀플렉스 음성 모델

StepAudio 3 Realtime은 ‘듣기·대화·사고·행동’의 연속 루프를 중심으로 설계된 오디오 언어 기반 모델입니다. 풍부한 음향 인식, 풀 듀플렉스 대화, 발화 중 병렬 추론, 비동기 도구 실행을 하나의 시스템으로 묶습니다.

더 보기