Realtime-Venus, 비동기 위임을 지원하는 풀듀플렉스 상호작용
배경
일반적인 음성 비서는 사용자가 말한 뒤 시스템이 처리하고 응답하는 순차적인 방식을 사용합니다. 하지만 화면의 변화를 계속 관찰하거나 외부 작업을 수행해야 하고, 사용자가 응답 중에도 말을 이어가는 상황에서는 이러한 구조가 지연과 문맥 단절을 일으킬 수 있습니다. Realtime-Venus는 지속적인 인식, 선제적 응답, 비동기 작업 위임을 하나의 실시간 상호작용 시스템으로 묶어 이 문제에 접근합니다.
두 개의 9B 모델
Realtime-Venus는 별도로 학습된 두 개의 9B 모델을 제공합니다. Realtime-Venus-Omni는 오디오·비디오 상호작용을 위해 설계되어 음성 및 언어 정보와 계속 변하는 시각적 맥락을 함께 처리합니다. Realtime-Venus-Audio는 음성 상호작용에 초점을 두고 연속 음성 입력 이해와 네이티브 음성 생성을 담당합니다.
두 모델은 단순한 인식 모듈이 아니라 지속적인 인식, 대화 제어, 음성 출력을 통합한 완전한 대화 프런트엔드로 설명됩니다. 또한 사용자 입력, 모델 출력, 작업 위임 이벤트를 하나의 인과적 타임라인에 배치합니다. 이 설계는 스트리밍 입력, 끼어들기, 중첩 발화, 대화 중 발생하는 문맥 변화를 동일한 시간축에서 처리하기 위한 기반입니다.
대화를 멈추지 않는 백그라운드 작업
실행 구조는 이중 루프로 구성됩니다. 포그라운드 루프는 실시간 대화를 유지하고, 백그라운드에서는 Realtime-Venus-Harness가 추론이나 도구 실행 등 위임된 작업을 처리합니다. 작업이 진행되는 동안에도 사용자는 시스템과 계속 상호작용할 수 있으며, 결과가 반환되면 진행 중인 대화에 통합됩니다.
이 방식은 복잡한 작업이 즉각적인 응답을 완전히 막지 않도록 합니다. 동시에 실시간 대화와 장시간 처리의 역할을 분리할 수 있습니다. 다만 제공된 자료에는 Harness가 지원하는 구체적인 도구, 배포 비용, 종단 간 지연 시간이 제시되어 있지 않습니다. 따라서 이 구조의 가능성과 모든 실제 환경에서의 준비도는 구분해 판단해야 합니다.
평가 결과와 의미
논문에 따르면 비교 대상 온라인 모델 가운데 Realtime-Venus-Omni는 8개 비디오 벤치마크 중 6개에서 가장 높은 점수를 기록했습니다. StreamingBench는 70.2%, OVO-Bench는 64.7%, Daily-Omni는 81.3%였습니다. Realtime-Venus-Audio는 8개 오디오 이해 및 음성 질의응답 벤치마크 중 MMAU, MMAU-Pro, Llama Questions, Speech CMMLU에서 비교 모델을 앞섰으며, 점수는 각각 78.0%, 63.2%, 83.8%, 67.8%로 보고되었습니다.
학습 레시피도 주목할 만합니다. 오프라인 이해 학습, 선제적 풀듀플렉스 대화 궤적, 위임 워크플로를 후학습 과정에 함께 포함했습니다. 이는 질문에 답하는 비서에서 벗어나, 대화를 유지하면서 장기 작업을 조율하는 상호작용 프런트엔드로 나아가려는 방향을 보여줍니다. 향후 실용성은 끼어들기 처리, 실패 복구, 도구의 신뢰성, 기기별 지연 시간에 달려 있을 것입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…