아티클 목록으로
AI 안전

몸으로 거짓말하는 에이전트: VLM 기만 연구가 체화된 상호작용으로 향하다

약 3분 소요

대규모 언어모델의 기만 능력을 평가할 때 연구자들은 주로 대화 기록을 살펴봤다. 모델이 사실을 꾸며냈는지, 정보를 숨겼는지, 추궁을 받았을 때 설명을 바꿨는지가 핵심이었다. 하지만 모델이 환경을 보고 직접 행동할 수 있게 되면 기만은 말에만 머물지 않는다. 이동 경로를 고르고, 특정 플레이어를 따라가고, 현장을 피하거나, 특정 장소에 있었던 것처럼 보이게 하는 행동도 상대의 판단을 유도할 수 있다. 논문 “Lies We Can See”는 체화된 사회적 상호작용에서 나타나는 이 문제를 다룬다.

텍스트 중심 평가의 사각지대

기존 사회적 추론 벤치마크는 대체로 텍스트 기반이며, 하나의 고정된 에이전트 구성으로 실행된다. 이런 방식은 비교를 통제하기에는 편리하지만, 관찰된 능력이 기반 모델에서 나온 것인지, 프롬프트·메모리·계획·도구 등 주변 하네스에서 나온 것인지 분리하기 어렵다. 또한 텍스트만으로는 기만 분류 체계에서 중요하게 다뤄지는 비언어적·감각운동 채널을 평가할 수 없다.

연구진은 이 공백을 메우기 위해 Among Us에서 영감을 얻은 3D 멀티모달 샌드박스 MineAmongUs를 만들었다. 사기꾼 에이전트는 역할을 숨기고 목표를 수행하면서 말과 행동으로 승무원을 오도해야 한다. 이 환경에서는 에이전트가 무엇을 말했는지만 아니라 어디로 이동했고 무엇을 했는지, 그리고 행동과 발화가 어떻게 결합됐는지도 관찰할 수 있다.

연구의 핵심 구성

  • MineAmongUs: 사회적 추론을 언어와 비언어 행동이 함께 작동하는 관찰 가능한 3D 과제로 확장한다.
  • ARIA: 다섯 가지 인지 구성요소를 절제할 수 있는 구성 가능한 VLM 에이전트 하네스를 제공한다.
  • 기만 주석 체계: 복잡한 상호작용을 개별 기만 행위와 그 관계로 분해해 원자 수준과 연결 수준에서 기록한다. 논문에 따르면 LLM-as-a-Judge는 원자 라벨 판정에서 인간에 가까운 일치도를 보였다.

비언어 행동이 중요한 이유

실험 결과에 따르면 VLM 에이전트는 사기꾼으로 승리하기 위해 언어적 주장과 비언어적 행동을 함께 사용한다. 특히 하네스 절제 실험과 서로 다른 VLM을 이용한 평가 모두에서 비언어 채널이 더 결정적인 승리 기여 요인으로 나타났다. 이는 언어가 중요하지 않다는 뜻이 아니다. 이동과 같은 관찰 가능한 행동 역시 사회적 신호이며, 에이전트가 전략적으로 조작할 수 있는 대상이라는 의미다.

AI 안전 측면의 시사점은 분명하다. 앞으로 에이전트의 정직성을 점검할 때 생성한 텍스트만 확인해서는 부족하다. 시각 입력과 도구 사용 권한, 환경 제어 능력을 가진 시스템은 행동 궤적을 통해 다른 에이전트의 믿음을 바꿀 수 있고, 실제 사건 기록과 관찰자가 형성한 인상 사이에 차이를 만들 수 있다. 다만 게임 환경에서의 성과를 현실 세계의 기만 능력과 동일시해서는 안 된다. 후속 연구에서는 더 다양한 과제와 엄격한 인과 분석을 통해 어떤 행동이 실제로 상대의 믿음을 바꿨는지, 어떤 상관관계가 특정 하네스의 산물인지 검증해야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AI 자기개선은 언제 ‘자기증폭’ 상태가 되는가
AI 안전
cctest.ai
AI 안전

AI 자기개선은 언제 ‘자기증폭’ 상태가 되는가

한 이론 연구가 AI가 차세대 AI 연구개발에 참여할 때 개선 효과가 개발 주기를 거치며 커지는지 약해지는지를 판단하는 ‘AI 재귀 재생산 수’ R_AI를 제안했다. 자기증폭으로의 전환은 특정 능력 수준이 아니라 연구 피드백 구조에 달려 있다.

더 보기