프로액티브 에이전트에 필요한 것은 정확성만이 아니다
서론: 답변을 넘어 행동할 시점을 판단하기
오늘날 많은 LLM 에이전트는 사용자의 명시적인 요청에서 출발한다. 질문을 받고 정보를 찾은 뒤 계획을 세워 작업을 수행하는 방식이다. 프로액티브 에이전트는 이 흐름을 뒤집는다. 사용자가 요청하기 전에도 가용한 연산 자원을 활용해 필요할 가능성이 있는 정보나 작업을 미리 준비하려 한다.
하지만 먼저 행동한다고 해서 항상 유용한 것은 아니다. 에이전트가 작업을 정확히 끝내더라도 사용자의 현재 상황을 잘못 해석할 수 있다. 시의적절하지 않은 알림이나 개입은 검토와 관리 비용을 늘리고, 사용자가 예상하지 못한 행동은 장기적인 신뢰를 떨어뜨릴 수 있다. 즉, 기술적으로 맞는 결과와 좋은 지원 경험은 같은 것이 아니다.
3T가 제시하는 세 가지 목표
논문은 프로액티브 에이전트를 다음 세 가지 목표를 함께 최적화하는 시스템으로 본다.
- Task Capability(작업 능력): 사용자와 관련된 필요를 예측하고, 가치 있는 작업을 정확하게 수행하는가.
- Temporal Allocation(시간 배분): 가용 연산량과 결과가 필요한 시점에 맞춰 처리 작업을 배분하는가.
- Trust(신뢰): 사용자의 확신을 유지하고, 맹신이나 과도한 재확인이 아닌 적절한 의존을 이끌어내는가.
이 세 목표는 서로 충돌할 수 있다. 일찍 처리하면 준비성은 높아지지만 결과가 낡거나 불필요해질 수 있다. 더 깊이 개입하면 자동화의 이점이 커지는 반면 실수와 감독 부담도 늘어난다. 따라서 단순한 정답률만으로는 프로액티브 에이전트의 품질을 설명하기 어렵다.
행동을 설계하는 다섯 가지 축
연구는 프로액티브 행동을 작업 범위, 예측 시야, 활성화 트리거, 처리 시점, 개입 깊이의 다섯 차원으로 설명한다. 이 축들은 무엇을 예측할지, 얼마나 앞서 볼지, 어떤 변화에 반응할지, 언제 계산할지, 사용자 결정을 어느 정도 대신할지를 결정한다.
기술적으로는 사용자와 환경, 변화하는 작업 상태를 지속적으로 표현해야 한다. 기반 LLM은 추론과 생성을 담당하고, 에이전트 하네스는 모니터링·계획·실행·대화를 조정한다. 핵심은 단순히 백그라운드 작업을 추가하는 것이 아니다. 상황에 따라 계속 관찰할지, 미리 준비할지, 확인을 요청할지, 직접 실행할지를 선택해야 한다.
Proactivity-Gym의 평가 방식
단일 턴 벤치마크는 한 번의 개입이 이후 상호작용에 미치는 영향을 거의 포착하지 못한다. Proactivity-Gym은 여러 날에 걸친 시나리오, 상태를 유지하는 환경, 페르소나 조건이 있는 시뮬레이션 사용자를 통해 이 문제를 다룬다. 평가 대상은 즉각적인 출력뿐 아니라 한 행동이 다음 상호작용에 남기는 결과다.
23개의 모델·하네스 구성을 평가한 결과, 3T 각 요소에서 상당한 성능 차이가 나타났다. 연구진은 LLM 기반 평가자가 작업 능력과 신뢰를 자주 혼동한다고도 지적한다. 30명이 참여한 인간 연구에서는 개입이 정확하더라도 사용자의 상황이나 기대와 어긋나면 신뢰가 급격히 낮아질 수 있다는 점이 드러났다.
의미와 영향
이 연구는 프로액티브 에이전트를 단순히 도구를 더 적극적으로 호출하는 시스템이 아니라, 시점·권한·비용·신뢰 관계를 함께 다루는 시스템으로 재정의한다. 앞으로는 에이전트가 무엇을 완료했는지만 볼 것이 아니라, 왜 그때 행동했는지, 사용자가 그 도움을 원했는지, 그 행동이 이후 의존 관계를 어떻게 바꾸는지도 평가해야 한다.
좋은 프로액티브 에이전트는 가장 자주 개입하는 시스템이 아닐 수 있다. 유용한 처리는 백그라운드에 두고, 필요한 순간에 적절한 깊이로 개입하는 시스템이 장기적인 신뢰를 얻을 가능성이 더 높다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…