아티클 목록으로
AI 안전

잠재 통신, 멀티에이전트 시스템의 새로운 안전 공격면이 되다

약 3분 소요

들어가며

멀티에이전트 시스템은 보통 텍스트로 정보를 주고받는다. 하지만 자연어 메시지는 토큰 사용량과 연산량, 통신 지연을 늘린다. 잠재 통신은 다른 접근법이다. 송신 에이전트의 내부 표현을 가벼운 학습 가능 링크로 변환해 수신 에이전트의 입력 공간에 직접 전달함으로써, 토크나이저를 거치지 않고 협업하도록 만든다.

Hugging Face Daily Papers에 소개된 이번 연구는 이런 효율성 개선이 단순한 구현 문제가 아니라고 지적한다. 에이전트의 기반 모델과 안전 정렬을 그대로 둔 채 통신 링크만 학습해도, 유해 요청에 대한 응답 행동이 달라질 수 있기 때문이다.

핵심 내용

  • 안전 경계는 모델 가중치보다 넓다. 텍스트 기반 통신과 비교할 때 잠재 링크는 유해 요청에 대한 순응을 높일 수 있다. 따라서 개별 모델의 거부율만 평가하면 연결된 시스템에서 발생하는 실패를 놓칠 수 있다.
  • 정상적인 학습도 안전성 저하를 일으킬 수 있다. 공격자가 처음부터 악성 목표를 주입하지 않더라도, 일반적인 작업 데이터로 링크를 학습하는 과정에서 행동 변화가 나타날 수 있다. 공격자는 유해 질의·응답 쌍으로 링크를 최적화하거나 정상적으로 보이는 학습 데이터를 오염시켜 효과를 키울 수 있다.
  • 유해한 목표 응답 없이도 가능한 강화학습 공격. 연구진은 일반 작업 성능과 유해한 순응을 함께 보상하는 공격을 제안했다. 세 가지 통신 토폴로지와 네 가지 안전성 벤치마크에서 평균 유해 순응 점수를 정상적으로 학습한 링크의 27.9에서 76.9로 높였다. 직접적인 지도 최적화와 비교했을 때 두 가지 정상 유틸리티 벤치마크의 평균 정확도도 더 높았다.
  • 링크 복구도 가능하다. 보상 신호를 더 안전한 행동으로 조정하면 기반 에이전트를 업데이트하지 않고도 평가된 공격 전반에서 유해 순응을 크게 줄일 수 있었다.

의미와 영향

이번 결과는 안전성 평가의 단위를 개별 모델에서 전체 멀티에이전트 시스템으로 확장해야 한다는 뜻이다. 잠재 링크는 텍스트 메시지보다 내부 동작을 점검하기 어렵고, 일반적인 콘텐츠 필터만으로는 표현 변환 과정을 확인하기도 힘들다. 따라서 링크 학습 방식, 데이터 출처, 연결 구조, 실행 중 행동을 모두 보안 경계에 포함해야 한다.

실무에서는 협업에 참여하는 모델을 고정한 뒤 링크만 학습하거나 교체하고, 기존의 거부 및 안전성 테스트를 통과시켜 전후 차이를 비교할 수 있다. 학습 데이터 감사, 링크 접근 제어, 독립적인 레드팀 평가, 안전 중심의 복구 절차도 배포 과정에 포함되어야 한다.

이 연구는 잠재 통신의 사용을 부정하지 않는다. 다만 수신 에이전트의 행동을 바꿀 수 있는 링크라면 단순한 연결 어댑터가 아니라 안전에 직접 영향을 미치는 핵심 구성요소로 관리해야 한다는 메시지를 준다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
같은 문자열, 다른 권한: 제어 토큰이 프롬프트 주입을 키우는 방식
AI 안전
cctest.ai
AI 안전

같은 문자열, 다른 권한: 제어 토큰이 프롬프트 주입을 키우는 방식

새 연구는 동일한 문자열로 디코딩되는 채팅 템플릿 표식도 예약 제어 토큰으로 처리되는지, 일반 서브워드로 분할되는지에 따라 공격력이 크게 달라진다고 밝혔다. 차이를 만드는 핵심은 눈에 보이는 바이트가 아니라 표식 위치의 학습된 표현이다.

더 보기