아티클 목록으로
AI 안전

HazardAuditor, 컴퓨터 사용 에이전트의 실행 단계 안전 감독 제안

약 3분 소요

들어가며

AI 시스템이 텍스트를 생성하는 데 그치지 않고 브라우저를 열고, 터미널 명령을 실행하고, 파일을 수정하며, 외부 서비스를 호출하기 시작하면 안전성 평가의 대상도 달라져야 한다. 위험은 입력 프롬프트나 최종 답변에 직접 나타나지 않고, 실행 중 이어지는 여러 행동의 조합에서 발생할 수 있기 때문이다.

HazardAuditor는 이런 컴퓨터 사용 에이전트의 특성을 반영해 실행 기반 안전 감독을 제안한다. 정적인 입력·출력만 판별하는 대신 에이전트가 실제 환경에서 어떤 도구와 명령을 사용했는지 기록하고, 이를 여러 시스템에서 학습할 수 있는 형태로 정리하는 것이 핵심이다.

핵심 내용

  • 실행 행동을 안전 평가에 포함. 기존 guard 모델은 대체로 프롬프트와 응답을 중심으로 판단한다. HazardAuditor는 도구 호출, 명령 실행, 환경과의 상호작용 등 런타임 이벤트까지 평가 범위를 넓힌다.
  • 이기종 프레임워크를 공통 형식으로 변환. Claude Code, Codex, Hermes, OpenClaw를 통제된 환경에서 실행한 뒤 각 시스템의 상호작용을 표준 이벤트 표현으로 정규화한다. 이를 통해 구현이 다른 에이전트 사이에서도 감독 데이터와 결과를 비교할 수 있도록 한다.
  • 생성형 guard의 학습 불일치를 완화. 토큰 단위 후처리 학습에서는 긴 추론문이 더 많은 업데이트를 차지해 최종 안전 판정의 중요성이 상대적으로 낮아질 수 있다. Guard Policy Optimization(GuardPO)은 결정론적인 안전 결과를 시퀀스 수준 advantage로 바꾸고, 추론 영역과 판정 영역을 정규화한다.
  • 여러 시스템에서 성능을 측정. 논문은 복수의 벤치마크와 이기종 컴퓨터 사용 시스템에서 기존 최강 guard 대비 최대 16.5%포인트의 정확도 향상을 보고한다. 코드와 모델, 평가 자료는 프로젝트 페이지를 통해 제공될 예정이라고 설명한다.

의미와 남은 과제

이 연구의 중요한 시사점은 에이전트 안전성을 발화 내용만으로 판단하기 어렵다는 데 있다. 도구를 사용할 수 있는 시스템에서는 무엇을 말했는지뿐 아니라 무엇을 했는지, 어떤 순서로 행동했는지, 환경에 어떤 변화를 만들었는지를 함께 봐야 한다. 공통 이벤트 표현은 서로 다른 에이전트 프레임워크를 가로지르는 관찰 계층이 될 수 있다.

GuardPO는 안전 모델의 설명 길이와 판정 품질을 분리하려는 접근이기도 하다. 긴 설명이 반드시 더 정확하거나 안전한 판단을 의미하지는 않는다. 안전 결과를 시퀀스 수준에서 최적화하면 모델이 형식적인 추론문을 길게 만드는 대신 실제 위험 분류를 개선하도록 학습 목표를 맞출 수 있다는 것이 제안의 방향이다.

다만 제공된 자료에는 각 벤치마크의 세부 결과가 포함되어 있지 않다. 따라서 16.5%포인트라는 수치는 논문이 사용한 평가 조건에서의 최대치로 이해해야 하며, 모든 에이전트나 실제 운영 환경에 그대로 적용된다고 볼 수는 없다. 향후에는 더 다양한 도구, 공격 시나리오, 업무 흐름에서 실행 기반 감독의 안정성을 검증해야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
GitLab 경고: AI 에이전트 샌드박스는 신뢰된 네트워크 경로로 무너질 수 있다
AI 안전
cctest.ai
AI 안전

GitLab 경고: AI 에이전트 샌드박스는 신뢰된 네트워크 경로로 무너질 수 있다

GitLab의 보안 분석은 AI 코딩 에이전트를 샌드박스에 격리하는 것만으로는 안전을 보장할 수 없다고 지적했다. 허용 목록에 포함된 서비스의 취약점이 외부 시스템으로 이어지는 통로가 될 수 있다.

더 보기