아티클 목록으로
AI 에이전트

AdvSim2Real, 진화하는 프롬프트 인젝션에 강한 웹 에이전트 훈련

약 3분 소요

들어가며

웹 에이전트에게 페이지 내용을 무조건 믿으라고 할 수도, 전부 무시하라고 할 수도 없습니다. 사용자의 요청을 처리하려면 페이지의 텍스트, 버튼, 양식, 상품 정보 등을 읽어야 합니다. 그러나 제3자는 같은 페이지에 “원래 작업을 무시하라”거나 “다른 행동을 수행하라”는 지시를 심을 수 있습니다. 에이전트가 페이지의 지시를 사용자의 의도와 혼동하면 간접 프롬프트 인젝션이 작업 전체의 결과를 바꿀 수 있습니다.

AdvSim2Real은 고정된 공격 사례를 반복하는 대신, 과제와 공격자, 에이전트를 함께 진화시키는 접근법을 제안합니다. 연구진은 세 요소를 고정된 웹 월드 모델 안에서 상호작용하게 하고, 시뮬레이션에서 학습한 능력과 견고성이 실제 브라우저로 옮겨가는지 확인했습니다.

핵심 내용

  • 학습 가치가 있는 난이도를 유지한다. 커리큘럼 모듈은 에이전트가 대략 절반의 확률로 해결하는 과제를 선호합니다. 너무 쉬운 과제는 금방 학습 신호를 잃고, 지나치게 어려운 과제는 유용한 피드백을 주기 어렵습니다. 성공과 실패의 경계를 따라가며 훈련의 긴장도를 유지합니다.
  • 공격의 외형보다 결과를 평가한다. 의심스러운 문장을 생성하는 것만으로는 충분하지 않습니다. 원래 성공할 실행을 실패로 바꾸는 인젝션만 공격자에게 보상됩니다. 따라서 공격 학습이 실제 사용자 목표의 결과와 직접 연결됩니다.
  • 세 구성요소가 함께 업데이트된다. 에이전트는 새 공격뿐 아니라 과거 공격에도 훈련되며, 에이전트가 강해질수록 과제 분포도 달라집니다. 고정 데이터셋을 모두 해결한 뒤 학습이 멈추는 문제를 줄이는 방식입니다.
  • 능력과 견고성을 동시에 높인다. 150개 웹 과제에서 4B 에이전트의 무공격 완료율은 74.89%에서 81.33%로, 공격 상황의 완료율은 48.07%에서 57.48%로 상승했습니다. 학습에 사용하지 않은 Kimi-K3 공격자에 대해서도 23.00%에서 30.72%로 개선되어 상대 향상률은 33.6%였습니다. 실제 브라우저의 엄격한 과제 성공률은 25.56%에서 44.44%로 올랐습니다.

의미와 한계

이 연구의 핵심은 악성 지시문 목록을 정적으로 확장하는 데 있지 않습니다. 현재 에이전트를 실제로 실패시키는 공격과, 계속 학습할 가치가 있는 과제를 함께 찾는 신호를 설계했다는 점이 중요합니다. 공격자가 문구와 배치를 바꿀 수 있는 현실의 환경에는 고정된 방어 데이터보다 더 가까운 설정입니다.

다만 결과는 제시된 실험 범위 안에서 해석해야 합니다. 시뮬레이터가 모든 웹사이트 구조, 도구 상호작용, 장기 작업의 실패 양상을 재현할 수는 없습니다. 실제 브라우저로의 전이는 고무적이지만 운영 환경의 보안을 입증하는 결과는 아닙니다. 더 다양한 사이트와 도구, 작업 유형, 텍스트 외 공격을 대상으로 한 검증이 필요합니다.

그럼에도 AdvSim2Real은 월드 모델을 이용해 저비용의 반복 가능한 공격 훈련을 수행하고, 에이전트의 성장에 맞춰 도전을 갱신하는 방향을 제시합니다. 웹 에이전트 보안을 일회성 미세조정이 아니라 지속적인 학습 커리큘럼으로 다룬다는 점에서 의미가 있습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
WebFovea: 모델은 맞는데 클릭이 틀리는 이유
AI 에이전트
cctest.ai
AI 에이전트

WebFovea: 모델은 맞는데 클릭이 틀리는 이유

WebFovea는 2026 WebRetriever Challenge에서 2위를 차지하며, 비전 기반 웹 에이전트의 성능이 모델 추론뿐 아니라 브라우저와 연결되는 실행 계층에도 달려 있음을 보여줬습니다. 같은 모델을 유지한 채 하네스를 개선해 히든 세트 점수를 31.0에서 57.0으로 높였습니다.

더 보기
CCTest · Blog
도구 사용 에이전트는 왜 실패하는가: 증거에서 행동까지의 단절
AI 에이전트
cctest.ai
AI 에이전트

도구 사용 에이전트는 왜 실패하는가: 증거에서 행동까지의 단절

에이전트가 최종적으로 올바른 상태에 도달하더라도, 그 행동이 사전에 확보된 증거에 근거했다고 보기는 어렵습니다. SafeActBench 연구는 실행 전 조사와 의존성이 있는 다단계 작업에서 실패가 집중된다는 점을 보여줍니다.

더 보기
CCTest · Blog
프로액티브 에이전트에 필요한 것은 정확성만이 아니다
AI 에이전트
cctest.ai
AI 에이전트

프로액티브 에이전트에 필요한 것은 정확성만이 아니다

프로액티브 LLM 에이전트는 사용자가 요청하기 전에 유휴 연산을 활용해 필요한 지원을 준비한다. 새로운 연구는 작업 능력, 시간 배분, 신뢰를 3T 원칙으로 정리하고 장기 효과를 평가하는 Proactivity-Gym을 제안했다.

더 보기