아티클 목록으로
AI 안전

다중 에이전트 LLM의 동조 압력이 컨포멀 예측을 무너뜨리는 방식

약 3분 소요

서론

컨포멀 예측은 LLM의 출력에 통계적 안전장치를 추가하는 방법으로 활용된다. 일정한 가정이 성립하면 예측 집합이 정답을 포함하는 비율을 통제할 수 있어, 모델이 무엇을 답할지뿐 아니라 언제 보류하거나 사람에게 검토를 요청해야 하는지도 판단하는 데 도움이 된다.

하지만 새로운 arXiv 논문은 다중 에이전트 LLM 시스템의 중요한 취약점을 지적한다. 모델이 혼자 답할 때는 유효했던 컨포멀 보증이, 다른 에이전트들의 답변을 본 뒤에는 더 이상 성립하지 않을 수 있다는 것이다. 질문과 정답, 입력 분포는 바뀌지 않는다. 달라지는 것은 모델이 후보 답안에 점수를 부여하는 방식이다.

핵심 내용

  • 분포 변화가 아니라 점수 행동의 변화다. 연구진은 이를 ‘점수 메커니즘 이동’이라고 정의한다. 독립 응답을 바탕으로 한 보정은 모델이 혼자 답할 때의 점수 산정만 설명하며, 동료의 의견을 접한 뒤의 행동은 보장하지 않는다.
  • 틀린 만장일치가 커버리지를 낮춘다. 여러 오픈웨이트 모델과 객관식 질의응답 과제에서 alpha=0.10 기준 커버리지는 보정된 90%에서, 동료들이 오답을 일제히 지지했을 때 74%로 떨어졌다.
  • 평균 지표는 선택적 공격을 가릴 수 있다. 공격자가 보증상으로는 여전히 커버되지만 확신도가 낮은 문제만 골라 잘못된 합의를 주입하면 커버리지는 87%에서 47%로 하락한다. 전체 평균만 보면 이런 취약성이 덜 심각해 보일 수 있다.
  • 최종 의사결정도 영향을 받는다. 불확실할 때 에스컬레이션해야 하는 시스템이 잘못된 동료 의견을 본 뒤 오히려 높은 확신을 얻고, 공격자가 유도한 오답을 실행할 수 있다.

기존 보정으로 충분하지 않은 이유

컨포멀 예측의 일반적인 대응은 보정 데이터를 다시 구성하거나 임계값과 유의수준을 조정하고, 입력 분포의 변화를 다루는 데 초점을 둔다. 그러나 이 사례는 질문 분포가 바뀐 문제가 아니다. 대화 맥락과 동료 의견 때문에 동일한 모델의 점수 산정 방식이 변한 문제다. 따라서 단독 응답만으로 만든 보정 데이터를 계속 사용한다고 해서 보증이 자동으로 복구되지는 않는다.

이는 투표, 토론, 상호 검증을 사용하는 다중 에이전트 설계에 특히 중요하다. 에이전트 간의 합의는 보통 신뢰성을 높이는 신호로 취급되지만, 여러 에이전트가 같은 오답을 반복하면 협업이 오류 수정 장치가 아니라 잘못된 확신을 증폭하는 압력원이 될 수 있다.

또한 전체 평균 커버리지만 모니터링해서는 부족하다. 선택적 공격자는 모든 사례를 망가뜨릴 필요가 없다. 보증이 취약한 사례를 찾은 뒤 그 지점에만 오해를 유도하는 합의를 제공하면 된다. 확신도, 동료 간 일치도, 에스컬레이션 여부별로 하위 집단을 분석해야 하는 이유다.

의미와 영향

이 연구는 컨포멀 예측이 LLM에 쓸모없다고 말하지 않는다. 대신 보증의 범위를 실제 보정이 이뤄진 정보 환경에 연결해야 한다고 지적한다. 단독 응답, 다른 에이전트의 답변을 본 경우, 오답에 대한 만장일치를 본 경우처럼 운영 중 발생할 상태를 나눠 평가하고 보정해야 한다.

AI 안전성 측면에서 중요한 질문은 단순히 “모델이 보정됐는가”가 아니다. 모델이 실제 운영 환경의 사회적·문맥적 입력 아래에서도 보정 상태를 유지하는가가 핵심이다. 다중 에이전트 시스템은 정답률과 평균 커버리지뿐 아니라 점수 변화, 선택적 공격, 에스컬레이션 행동까지 함께 점검해야 한다.

출처: arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
간접 프롬프트 인젝션은 왜 테스트 시점 탐색 문제인가
AI 안전
cctest.ai
AI 안전

간접 프롬프트 인젝션은 왜 테스트 시점 탐색 문제인가

새로운 arXiv 논문은 간접 프롬프트 인젝션을 피해 에이전트의 고정된 취약점으로만 봐서는 안 된다고 주장합니다. 공격자가 시스템의 공격면을 얼마나 효과적으로 탐색하고, 어느 정도의 테스트 시점 연산을 사용할 수 있는지가 공격 성공에 영향을 줍니다.

더 보기
CCTest · Blog
Gemini로 등산 계획한 3명, 샤스타산에서 구조돼
AI 안전
cctest.ai
AI 안전

Gemini로 등산 계획한 3명, 샤스타산에서 구조돼

미국 캘리포니아주 샤스타산에서 Google Gemini를 이용해 원정을 계획한 등산객 3명이 구조됐다. 이번 사건은 위험한 야외 활동에서 범용 AI의 답변을 현지 공식 정보와 전문적인 안전 판단의 대체재로 사용해서는 안 된다는 점을 보여준다.

더 보기