LLM 에이전트는 왜 특정 출처를 선호하는가
AI 에이전트가 사용자를 대신해 상품을 고르고, 호텔을 예약하고, 인용할 논문을 선택할 때 사람들은 모델이 가격, 기능, 위치, 관련성 같은 속성을 비교한다고 생각합니다. 그러나 새로운 연구는 후보가 어디에서 왔는지, 즉 정보의 출처도 선택에 조용히 영향을 줄 수 있다고 지적합니다.
출처 라벨이 선택을 바꾼다
서울대학교 연구팀은 쇼핑, 호텔, 학술 검색이라는 세 영역에서 12개 에이전트 모델의 종단 간 검색 행동을 조사했습니다. 연구진은 서로 다른 사이트나 서비스에서 나온 후보를 같은 위치에 배치하고, 가능한 한 동일한 사용자 요구사항을 충족하도록 구성해 출처 자체의 효과를 살폈습니다.
그 결과 모든 영역에서 각 모델이 특정 출처를 선호하고 다른 출처를 피하는 경향이 확인됐습니다. 어떤 출처가 선호되는지에 대해서는 모델 사이에도 상당한 공통성이 나타났습니다. 이는 단순히 더 적합한 후보가 선택됐다는 의미가 아닙니다. 선호 출처의 후보가 비선호 출처의 더 나은 후보보다 요구사항을 하나 덜 충족하는 상황에서도, 전자가 약 3분의 2의 비율로 선택됐습니다. 출처 선호와 후보의 품질이 반대 방향인 경우에는 더 나은 후보가 거의 선택되지 않았습니다.
후보 자체를 바꾸지 않고 출처를 식별하는 정보만 숨겨도 선호는 약해졌습니다. 반대로 후보에 선호되는 출처의 라벨을 붙이면 선택률이 높아졌습니다. 이는 출처 이름이 후보의 실제 속성을 해석하기 위한 보조 정보에 그치지 않고, 독립적인 결정 신호로 작동할 수 있음을 보여줍니다.
출처 선호가 생기는 두 가지 경로
연구진은 두 가지 가능성을 제시합니다. 첫째는 학습 중 형성된 지름길입니다. 어떤 출처가 더 나은 결과와 반복적으로 함께 등장하면, 에이전트는 그 출처를 품질의 대리 지표로 사용할 수 있습니다. 이런 상관관계가 계속 유지된다면 편리하지만, 새로운 후보를 평가할 때 직접 확인할 수 있는 속성보다 출처를 우선하게 만들 위험도 있습니다.
둘째는 정보 부족에서 비롯되는 추론입니다. 가격, 기능, 제한 조건, 사용자 요구와의 적합도 같은 세부 정보가 빠져 있으면 모델은 출처에 대한 기존 인상으로 빈틈을 메울 수 있습니다. 출처가 단순한 메타데이터가 아니라 제공되지 않은 속성을 추정하는 근거가 되는 것입니다.
편향을 줄이는 방법
실험 결과는 전체 모델을 다시 학습하지 않고도 완화할 수 있음을 시사합니다. 후보에 부족한 핵심 정보를 추가하면 출처 기반 추론의 여지가 줄어듭니다. 또한 프롬프트에서 출처만으로 제공되지 않은 특성을 추론하지 말라고 명시하면 선호가 약해질 수 있습니다.
실제 시스템에서는 먼저 사용자의 요구사항을 구조화하고, 후보마다 조건을 하나씩 검증한 뒤, 관찰 가능한 속성에 근거해 선택 이유를 설명하도록 하는 방식이 바람직합니다. 평가 과정에서도 출처 라벨을 숨기거나 바꿨을 때 결론이 크게 달라지는지 확인해야 합니다. 검색, 추천, 대리 구매가 확산될수록 성공률만으로는 충분하지 않습니다. 출처에 흔들리지 않는 판단과 불완전한 정보를 다루는 능력도 에이전트의 핵심 평가 기준이 되어야 합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…