StepGuard, LLM 에이전트의 도구 호출을 단계별로 사전 점검
왜 단계별 방어가 필요한가
LLM 에이전트가 파일을 수정하고, 정보를 읽고, 외부 서비스를 호출할 수 있게 되면서 단순한 텍스트 생성 시스템은 실제 환경에서 행동하는 시스템으로 바뀌고 있다. 그러나 도구 사용 능력은 보안 위험도 함께 키운다. 부적절한 파일 변경, 정보 유출, 승인되지 않은 작업은 한 번 실행되면 사후 검토만으로 되돌리기 어렵다.
기존 가드레일은 에이전트의 전체 궤적이 완료된 뒤 안전성을 판정하는 경우가 많다. 이런 방식은 결과 평가에는 유용하지만, 위험한 도구 호출 자체를 실행 전에 막는 데는 한계가 있다. StepGuard는 이 문제를 단계 단위의 사전 점검으로 다룬다. 완성된 궤적을 감사할 뿐 아니라, 개별 도구 행동이 실행되기 전에 허용 가능한지 확인한다.
주요 설계
- 행동 단위의 모니터링. 에이전트의 전체 실행을 하나의 판단 대상으로 취급하지 않고, 현재 문맥에서 바로 다음 도구 호출이 적절한지 평가한다. 따라서 실행 직전의 제어 지점을 마련할 수 있다.
- StepGen 데이터 엔진. StepGen은 같은 문맥을 유지하면서 위험한 단계의 행동만 바꾼 안전한 궤적과 위험한 궤적을 자동으로 만든다. 서로 다른 문맥을 비교하는 대신, 실제 안전성 차이가 행동에 있다는 점을 학습시키는 구성이다.
- Balance-GRPO 학습. 가드 모델은 위험한 행동을 허용하는 과소 방어와 정상 행동을 막는 과잉 방어 사이에서 균형을 찾아야 한다. Balance-GRPO는 안전 행동과 비안전 행동에서 관측된 정확도에 따라 학습의 초점을 동적으로 조정한다.
실험이 보여준 것
자료에 따르면 StepGuard는 평가된 오픈 웨이트 가드 모델 가운데 가장 높은 평균 정확도를 기록했으며, GPT-5.4와 비교 가능한 성능을 보였다. AgentDojo와 AgentDyn에서 에이전트를 보호했을 때는 가드가 없는 설정보다 평균 공격 성공률이 77.3% 낮아졌고, 평균 효용은 2.8%포인트만 감소했다.
이 수치는 안전한 시스템이 모든 불확실한 행동을 거부해서는 안 된다는 점을 보여준다. 실제 에이전트가 유용하려면 위험한 호출은 차단하되 정상적인 작업 흐름은 가능한 한 유지해야 한다. 실행 전 단계 검사는 권한 관리, 샌드박스, 사람의 승인 절차와 결합할 수 있는 추가 방어층으로 해석할 수 있다.
다만 제공된 소재만으로는 새로운 공격 유형에 대한 일반화, 실제 서비스에서의 지연 시간, 오탐지 비용을 확인할 수 없다. 따라서 StepGuard를 에이전트 보안의 완전한 해법이라기보다, 결과를 사후 평가하는 방식에서 행동 과정을 실시간에 가깝게 통제하는 방식으로 확장한 연구로 보는 편이 정확하다.
핵심은 세 가지다. 세밀한 행동 판정, 확장 가능한 안전 감독 데이터, 그리고 안전성과 효용을 함께 최적화하는 학습이다. 이 조합은 도구 호출이 많은 LLM 에이전트를 배포하려는 팀이 검토할 만한 실용적 방향을 제시한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…