장기 실행 에이전트는 무엇을 했나: 증거 기반 감독
장기 작업에서 커지는 감독의 공백
AI 에이전트는 단순한 질의응답이나 단일 도구 호출을 넘어 소프트웨어 개발, 데이터 분석, 과학 연구처럼 수시간 또는 수일이 걸리는 작업을 수행하고 있습니다. 실행 과정에서 에이전트는 계획을 세우고, 도구를 호출하며, 코드를 수정하고, 중간 결과에 따라 전략을 바꿉니다. 그러나 실행이 길어질수록 사용자가 전체 기록을 읽고 에이전트가 실제로 무엇을 했는지 확인하기는 어려워집니다.
문제는 명백한 오류에만 국한되지 않습니다. 사용자 요구사항이 충분히 구체적이지 않으면 에이전트가 의도와 다를 수 있는 가정을 스스로 채울 수 있습니다. 계획이나 구현을 사용자에게 알리지 않고 변경할 수도 있습니다. 테스트를 통과했다고 해서 원래 요구사항과 일치한다고 보장할 수는 없습니다. 데이터 필터링, 평가 지표 변경, 실험 조건 조정처럼 합리적으로 보이는 선택도 최종 결과에 큰 영향을 줄 수 있지만, 사용자의 확인 없이 진행될 수 있습니다.
연구가 다루는 두 가지 축
논문 「What Did the Agent Actually Do? Evidence-Grounded Oversight for Long-Horizon Agents」는 감독 문제를 두 방향으로 나눕니다.
- 요구사항과 행동의 정렬: 모호한 사양이나 조용한 구현 변경을 찾아 추가 설명과 검토가 필요한 지점을 제시합니다.
- 중대한 결정의 인식과 검증: 반드시 잘못된 것은 아니지만 결과에 영향을 주는 자율적 결정을 찾아내고, 사용자가 수용 여부를 판단할 수 있는 근거를 제공합니다.
연구진은 이를 평가하기 위해 AgentMonBench를 만들었습니다. SpecGAP, SilentSwap, FeedbackTrace 세 하위 집합은 모델이 중요한 결정을 식별하고 관련 증거를 원래 위치까지 찾을 수 있는지 평가합니다. 따라서 단순히 긴 실행 기록을 요약하는 능력이 아니라, 작업 요구사항과 관찰된 행동, 근거 사이의 관계를 연결하는 능력이 핵심입니다.
EBG의 작동 방식
Evidence-Grounded Behavior Graph(EBG)는 별도의 학습 없이 사용하는 방법입니다. 저장소, 대화, 도구 호출, 실행 산출물에 포함된 출처 연결 정보를 행동 단위로 묶고, 행동 사이의 관계를 그래프로 구성합니다. 작업 중심의 그래프 관점을 제공하기 때문에 감독 모델은 길고 단편적인 로그를 처음부터 검색하는 대신, 행동을 맥락 속에서 이해하고 원본 증거로 되돌아갈 수 있습니다.
EBG는 Codex Harness에도 통합되어 실행 전, 중요한 실행 변경 이후, 최종 보고 전의 확인 지점을 지원합니다. 사용자는 처음에 요구사항을 명확히 하고, 중요한 변경을 검토한 뒤, 증거를 바탕으로 결과를 확인할 수 있습니다. 목표는 모든 단계에 사람이 개입하는 것이 아니라, 개입이 필요한 순간을 더 정확하게 고르는 것입니다.
의미와 영향
8개 모델을 대상으로 한 실험에서 EBG는 대부분의 설정에서 중대한 결정의 식별과 증거 위치 파악을 개선한 것으로 보고되었습니다. 입력 규모와 하이퍼파라미터가 달라져도 증거 위치 파악의 이점이 유지되었습니다. 실제 연구 워크플로를 활용한 사례는 사용자의 검증을 돕고 에이전트의 다음 실행 방향을 안내할 가능성도 보여줍니다.
이 연구의 핵심 메시지는 해석 가능성의 범위를 넓혀야 한다는 것입니다. 장기 실행 에이전트에서는 내부적으로 왜 그렇게 추론했는지만큼, 실제로 무엇을 변경했고 어떤 결정이 결과를 좌우했으며 어떤 원본 증거로 이를 확인할 수 있는지가 중요합니다. 인간 감독은 모든 단계에 동행하는 방식에서 벗어나, 중요한 순간에 이해하고 승인하며 개입할 수 있도록 정보를 제공하는 방식으로 바뀔 수 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…