LLM 에이전트에는 정확도뿐 아니라 틀릴 수 있음을 아는 능력이 필요하다
들어가며
검색된 근거가 언어 모델의 기존 지식과 충돌할 때, 에이전트의 능력은 단순히 답을 내놓는 데서 끝나지 않는다. 결론을 수정할지, 근거가 일치하지 않는다고 설명할지, 아니면 기존 판단을 계속 유지할지가 중요하다. 논문 「Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict」는 바로 이 행동을 평가한다.
기존 에이전트 평가는 과제를 성공했는지와 최종 답변이 맞았는지에 주로 집중했다. 그러나 이런 지표만으로는 서로 다른 정보가 제시됐을 때 시스템이 어떤 판단 과정을 거쳤는지 알기 어렵다. 연구진은 이를 보완하기 위해 인식론적 겸손(EH)을 제안했다. 이는 실행 중 불확실성을 인식하고, 그에 맞춰 행동하며, 결과에 반영해 전달하는 의지와 능력을 뜻한다.
핵심 내용
- ISE로 행동을 나눈다. Identify는 지식 또는 근거의 충돌을 발견하는 단계다. Solve는 검증, 비교, 통합 등을 통해 충돌을 해결하려는 행동이며, Escalate는 해결되지 않은 불확실성을 사용자나 상위 절차에 명확히 알리는 것이다.
- 두 가지 충돌 상황을 다룬다. 첫째는 모델의 파라미터 지식과 검색 근거가 불일치하는 통제된 충돌이다. 둘째는 다단계 에이전트 실행 중 서로 다른 문맥 자료가 자연스럽게 충돌하는 경우다. 두 설정 모두 충돌이 없는 대응 조건과 함께 평가했다.
- 정확도와 겸손은 일치하지 않는다. 네 개 에이전트를 평가한 결과, 실행 도중 충돌을 알아차리고도 최종 답변에서는 해결되지 않은 불확실성을 언급하지 않는 구성이 있었다. 이 경우 틀린 결론을 지나치게 확신하는 어조로 제시할 수 있다.
- 초기 탐지가 후속 단계로 이어지지 않는다. 에이전트는 실행 초기에 모순을 감지하지만, 이후 추론과 도구 사용, 답변 작성 과정에서 해당 문제를 계속 추적하거나 해결하지 못하는 경우가 많았다.
- 개선에는 비용이 따른다. 모델 수준의 개입은 EH를 높일 수 있지만 과제 정확도를 낮추기도 한다. 인식론적 겸손은 기반 모델만의 속성이 아니라 에이전트 하네스와 평가 환경의 상호작용으로 형성된다는 의미다.
의미와 영향
이 연구는 “확신할 수 없을 때 이를 인정하는가”를 추상적인 모델 특성이 아니라 실행 궤적에서 측정할 수 있는 평가 항목으로 바꿨다. 연구, 법률, 의료, 기업 업무처럼 오류의 비용이 큰 분야에서는 단순한 오답보다, 충돌하는 근거를 접하고도 그 사실을 최종 출력에서 숨기는 행동이 더 위험할 수 있다.
앞으로의 에이전트 벤치마크는 최종 정확도 외에도 충돌 탐지, 근거 확인, 상태 유지, 상위 절차로의 보고를 따로 측정할 필요가 있다. 또한 정답을 냈지만 불확실성을 설명하지 않은 경우와, 오답이더라도 해결되지 않은 문제를 투명하게 밝힌 경우를 구분해야 한다. 다만 신중함을 높인다는 것은 단순히 “모르겠다”는 답을 늘리는 일이 아니다. 좋은 에이전트는 변화하는 근거에 따라 판단을 갱신하고, 남은 불확실성을 분명히 전달하면서도 정상적인 과제를 계속 수행해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…