오디오 LLM은 행동 전에 제대로 들을까? VGBench가 문맥 게이팅을 평가
들어가며
음성 비서의 치명적인 실수는 말을 잘못 알아듣는 것만이 아닙니다. 명령의 내용을 정확히 파악하고도 그 말이 자신에게 향하지 않았다는 사실을 판단하지 못해 도구를 실행하는 것도 문제입니다. 여러 사람이 있는 공간에서는 사용자가 다른 사람과 대화하거나 혼잣말을 할 수 있고, 멀리 있는 사람이 같은 문장을 말할 수도 있습니다. 따라서 에이전트는 응답하거나 행동하기 전에 자신이 호출된 것인지 먼저 판단해야 합니다.
논문 ‘Do Audio LLMs Listen Before They Act?’는 이러한 판단을 행동 수준에서 측정하는 VGBench를 제안했습니다.
핵심 내용
- 음성 인식이 아니라 행동 선택을 평가합니다. VGBench는 1,018개 진단 항목으로 구성되며, 모든 항목에서 가능한 행동을 ‘침묵’, ‘도구 호출’, ‘자연어 응답’으로 통일했습니다. 이를 통해 모델이 들은 내용을 적절한 행동으로 연결하는지 확인합니다.
- 오작동이 일어나기 쉬운 상황을 다룹니다. 평가에는 옆 대화, 혼잣말, 화자 전환이 포함됩니다. 화자 전환 쌍에서는 지정된 단어를 고정하고 음원, 거리감의 음향 표현, 시간적 경계만 바꿔 착용자에서 주변인으로 바뀌는 상황을 통제했습니다.
- 원시 모델은 멈추는 데 약합니다. 6개 원시 Audio LLM과 3개 학습 없는 적응 방식은 목표 도구를 찾아내는 경우가 많았지만, 화자가 바뀐 뒤 행동을 억제하는 경우는 드물었습니다. 원시 모델 중 가장 높은 전환 음소거율도 14%에 그쳤습니다.
- 추가 학습으로 게이팅이 개선됩니다. VoxGate 사례에서 지도학습은 전환된 명령의 91.3%를 음소거했습니다. 동시에 가까운 착용자 명령과 텍스트 전용 제어에서는 모두 올바른 도구를 선택했습니다. 탐색적 GRPO 단계에서는 옆 대화 정확도가 68.4%에서 70.9%로, 혼잣말 음소거율이 52.0%에서 60.0%로 상승했습니다.
의미와 영향
VGBench의 의미는 ‘이 발화가 자신에게 향했는가?’라는 제품상의 모호한 문제를 측정 가능한 진단 과제로 바꾼 데 있습니다. 결과는 행동 게이팅이 단순한 화자 식별과 다르다는 점을 보여줍니다. 모델은 음원 변화, 거리감, 시간적 경계, 대화 맥락을 함께 고려해야 합니다.
요인별 통제 실험에서는 음원 변화 자체가 독립적인 영향을 주는 것으로 나타났습니다. 반면 원거리 음향 조작에 대한 민감도는 음향 렌더링 방식에 따라 달랐습니다. 실제 서비스에서는 한 가지 녹음 조건에서 성공한 모델이 다른 공간적 표현에서도 같은 방식으로 반응한다고 보장하기 어렵습니다.
스마트 스피커, 이어버드, 도구를 사용하는 음성 에이전트에게 침묵은 기능의 부재가 아니라 안전한 행동입니다. 앞으로의 평가에서는 무엇을 들었는지와 어떤 도구를 골랐는지만 볼 것이 아니라, 누구에게 한 말인지 판단했는지, 그리고 불확실할 때 행동을 자제할 수 있는지도 확인해야 합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…