아티클 목록으로
AI 에이전트

LLM 에이전트는 왜 철회된 사용자 지시를 계속 따를까

약 3분 소요

들어가며

사용자는 첫 메시지에서 완성되고 고정된 요청을 전달하지 않는 경우가 많다. 초안을 작성해 달라고 한 뒤 형식을 바꾸거나, 특정 조건을 삭제하거나, 앞서 내린 결정을 명시적으로 철회할 수 있다. 사람은 보통 최신의 유효한 요구사항을 우선한다. 그러나 LLM 에이전트는 더 이상 유효하지 않은 정보를 자동으로 지우지 않는다. 이전 조건이 최종 답변에 남거나 도구 호출 인자에 반영될 수 있다.

논문 When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents는 이 문제를 ‘의도 드리프트’라고 부른다. 긴 대화에서 오류가 늘어난다고 말하는 데 그치지 않고, 이 실패를 재현 가능한 평가 과제로 만들고 완화 방법까지 검토했다는 점이 핵심이다.

핵심 내용

  • IntentFlux는 통제된 대화 평가를 제공한다. 연구진은 검증 가능한 작업을 의도 변경이 포함된 대화로 변환하면서 원래 작업의 채점기를 유지했다. 따라서 최종 작업을 한 번에 받은 모델과, 변화하는 대화에서 최종 작업을 복원해야 하는 모델을 동일한 기준으로 비교할 수 있다.
  • 오래된 정보가 많을수록 성능이 하락한다. 627개 보정 사례에서 대체되거나 철회된 정보가 늘어나자 평균 작업 점수는 0.476에서 0.384로 내려갔다. 8개 모델 비교에서도 같은 최종 작업을 단일 턴으로 제시했을 때보다, 다중 턴 대화에서 복원하게 했을 때 완전 정답 비율이 유의미하게 낮았다.
  • 명시적 상태 관리가 개선을 만든다. StateForge는 답변 생성이나 실행 전에 현재 활성 상태인 요구사항을 별도로 관리한다. General-Test에서 평균 점수는 0.367에서 0.467로 상승했다.
  • 상태만 정확히 알아도 충분하지 않다. 정답인 최종 상태를 제공했을 때 성능은 더 좋아졌지만 단일 턴 수준에는 도달하지 못했다. 문제는 최종 의도를 추정하는 과정뿐 아니라, 그 상태를 답변과 실행에 활용하는 과정에도 있다는 뜻이다.

의미와 영향

이 연구는 에이전트의 컨텍스트 관리가 대화 기록을 많이 보존하는 것과 같지 않다는 점을 보여준다. 도구를 사용하는 시스템은 현재 유효한 제약, 변경된 요구, 명시적으로 철회된 내용을 구분해야 한다. 오래된 지시가 프롬프트 안에서 계속 같은 영향력을 갖는다면, 모델이 충분한 지식과 도구를 갖추고 있어도 이미 폐기된 계획을 실행할 수 있다.

IntentFlux의 중요한 점은 막연했던 대화 실패를 재현 가능한 평가 문제로 바꾼 것이다. 작업 자체, 대화의 변화, 채점 기준을 분리해 살펴볼 수 있어 성능 저하가 어디에서 발생하는지 분석하기 쉽다. StateForge는 실행 전 구조화된 상태 정리 단계를 추가하는 방식이 유효할 수 있음을 보여주지만, 완전한 해결책은 아니다.

실제 제품에서는 되돌릴 수 없는 도구 작업 전에 에이전트가 현재 유효하다고 판단한 목표와 제약을 보여주고, 충돌이 감지되면 확인을 요청하는 설계가 중요하다. 이 논문은 의도 드리프트를 해결했다고 주장하지 않는다. 대신 다중 턴 에이전트를 측정하고 개선하기 위한 분명한 출발점을 제시한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
X-Tree: 재사용 가능한 경험을 AI 에이전트 학습에 넣다
AI 에이전트
cctest.ai
AI 에이전트

X-Tree: 재사용 가능한 경험을 AI 에이전트 학습에 넣다

X-Tree는 에이전트 궤적에서 반복적으로 등장하고 성공과 관련된 행동 구간을 자동으로 찾아 재사용 가능한 경험 트리로 구성합니다. 추가적인 LLM 호출 없이 오프라인 강화학습, RLVR, 자기 증류에 활용할 수 있습니다.

더 보기
CCTest · Blog
검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법
AI 에이전트
cctest.ai
AI 에이전트

검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법

자가 진화 검색 에이전트는 서로의 같은 오류를 정답처럼 강화해 내부 보상만 높일 수 있다. CrossFit은 학습 데이터와 평가 경로의 출처를 분리해 이런 피드백 고리를 약화한다.

더 보기