아티클 목록으로
AI 안전

StepGuard, LLM 에이전트의 도구 호출을 단계별로 사전 점검

약 3분 소요

왜 단계별 방어가 필요한가

LLM 에이전트가 파일을 수정하고, 정보를 읽고, 외부 서비스를 호출할 수 있게 되면서 단순한 텍스트 생성 시스템은 실제 환경에서 행동하는 시스템으로 바뀌고 있다. 그러나 도구 사용 능력은 보안 위험도 함께 키운다. 부적절한 파일 변경, 정보 유출, 승인되지 않은 작업은 한 번 실행되면 사후 검토만으로 되돌리기 어렵다.

기존 가드레일은 에이전트의 전체 궤적이 완료된 뒤 안전성을 판정하는 경우가 많다. 이런 방식은 결과 평가에는 유용하지만, 위험한 도구 호출 자체를 실행 전에 막는 데는 한계가 있다. StepGuard는 이 문제를 단계 단위의 사전 점검으로 다룬다. 완성된 궤적을 감사할 뿐 아니라, 개별 도구 행동이 실행되기 전에 허용 가능한지 확인한다.

주요 설계

  • 행동 단위의 모니터링. 에이전트의 전체 실행을 하나의 판단 대상으로 취급하지 않고, 현재 문맥에서 바로 다음 도구 호출이 적절한지 평가한다. 따라서 실행 직전의 제어 지점을 마련할 수 있다.
  • StepGen 데이터 엔진. StepGen은 같은 문맥을 유지하면서 위험한 단계의 행동만 바꾼 안전한 궤적과 위험한 궤적을 자동으로 만든다. 서로 다른 문맥을 비교하는 대신, 실제 안전성 차이가 행동에 있다는 점을 학습시키는 구성이다.
  • Balance-GRPO 학습. 가드 모델은 위험한 행동을 허용하는 과소 방어와 정상 행동을 막는 과잉 방어 사이에서 균형을 찾아야 한다. Balance-GRPO는 안전 행동과 비안전 행동에서 관측된 정확도에 따라 학습의 초점을 동적으로 조정한다.

실험이 보여준 것

자료에 따르면 StepGuard는 평가된 오픈 웨이트 가드 모델 가운데 가장 높은 평균 정확도를 기록했으며, GPT-5.4와 비교 가능한 성능을 보였다. AgentDojo와 AgentDyn에서 에이전트를 보호했을 때는 가드가 없는 설정보다 평균 공격 성공률이 77.3% 낮아졌고, 평균 효용은 2.8%포인트만 감소했다.

이 수치는 안전한 시스템이 모든 불확실한 행동을 거부해서는 안 된다는 점을 보여준다. 실제 에이전트가 유용하려면 위험한 호출은 차단하되 정상적인 작업 흐름은 가능한 한 유지해야 한다. 실행 전 단계 검사는 권한 관리, 샌드박스, 사람의 승인 절차와 결합할 수 있는 추가 방어층으로 해석할 수 있다.

다만 제공된 소재만으로는 새로운 공격 유형에 대한 일반화, 실제 서비스에서의 지연 시간, 오탐지 비용을 확인할 수 없다. 따라서 StepGuard를 에이전트 보안의 완전한 해법이라기보다, 결과를 사후 평가하는 방식에서 행동 과정을 실시간에 가깝게 통제하는 방식으로 확장한 연구로 보는 편이 정확하다.

핵심은 세 가지다. 세밀한 행동 판정, 확장 가능한 안전 감독 데이터, 그리고 안전성과 효용을 함께 최적화하는 학습이다. 이 조합은 도구 호출이 많은 LLM 에이전트를 배포하려는 팀이 검토할 만한 실용적 방향을 제시한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LMSM, 리눅스 보안 모듈 구조를 LLM 런타임 방어에 적용
AI 안전
cctest.ai
AI 안전

LMSM, 리눅스 보안 모듈 구조를 LLM 런타임 방어에 적용

LMSM은 모델 내부 증거, 정책 판단, 출력 해제를 분리해 해석 가능성 연구 결과를 LLM 서비스의 런타임 방어에 연결하는 프레임워크입니다. Qwen3-4B 프로토타입은 공격 성공률을 크게 낮추면서 모니터링이 없는 경로에 가까운 처리량을 유지했습니다.

더 보기
CCTest · Blog
언어 모델 양자화가 숨은 백도어를 활성화할 수 있다
AI 안전
cctest.ai
AI 안전

언어 모델 양자화가 숨은 백도어를 활성화할 수 있다

새 연구는 FP16 같은 고정밀 모델이 안전성 검사를 통과했더라도 INT8이나 4비트로 양자화한 뒤의 동작까지 안전하다고 볼 수 없다고 지적합니다. 압축 과정에서 잠재된 악성 동작이 드러나거나 활성화될 수 있다는 설명입니다.

더 보기
CCTest · Blog
LongGuard, 긴 문맥에서 안전 가드레일이 무너지는 원인 분석
AI 안전
cctest.ai
AI 안전

LongGuard, 긴 문맥에서 안전 가드레일이 무너지는 원인 분석

LongGuard 연구는 무해한 텍스트가 늘어날수록 안전 가드레일이 위험한 내용을 놓치기 쉬워진다는 점을 밝혔다. 주의력 희석에서 로짓 마진 축소, 탐지 붕괴로 이어지는 경로를 분석하고 추가 학습 없는 대응책을 제시한다.

더 보기