아티클 목록으로
AI 에이전트

WebFovea: 모델은 맞는데 클릭이 틀리는 이유

약 3분 소요

들어가며

비전 기반 웹 에이전트는 화면을 이해하고 다음 행동을 고르는 것만으로는 충분하지 않습니다. 모델의 결정을 브라우저 동작으로 정확히 변환하고, 동작이 실제로 적용됐는지 확인한 뒤, 변경된 페이지 상태를 다시 모델에 올바르게 전달해야 합니다. WebFovea는 모델과 실제 웹사이트 사이에서 발생하는 이 왕복 과정에 주목했습니다.

WebFovea는 WebRetriever Challenge 2026에서 2위를 기록했으며 최종 점수는 100점 만점에 57.0점이었습니다. 이 대회의 Protocol III는 진입 URL에서 시작해 사이트가 제공하는 자체 인터페이스를 사용하고, 검증 가능한 답을 제출하도록 요구합니다. 연구진은 네 번의 제출에서 같은 모델을 사용했습니다. 따라서 31.0에서 57.0으로의 상승은 주로 하네스 변경의 결과이며, 라이브 사이트 실행에서 발생하는 변동 가능성은 남아 있습니다.

핵심 관찰

  • 파싱 오류가 올바른 판단을 망친다: 출력 파서가 특수 토큰을 제대로 처리하지 못하면 모델이 생성한 채팅 템플릿 토큰이 일반 텍스트로 검색창에 입력될 수 있습니다. 연구진은 이런 문제가 전체 에피소드의 4.9%에서 나타났다고 보고했습니다.
  • 좌표계가 일치해야 한다: 좌표 공간의 불일치로 모든 클릭이 의도한 위치의 4분의 3 지점에 도달한 사례가 있었습니다. 스크린샷과 좌표에 의존하는 에이전트에서는 작은 변환 오류도 연속 작업을 무너뜨릴 수 있습니다.
  • 웹 컨트롤은 조용히 실패할 수 있다: 네이티브 드롭다운, iframe 내부 요소, 텍스트 입력창은 동일한 클릭이나 키보드 인터페이스로 항상 조작되지 않습니다. 실패를 감지하지 못하면 에이전트는 실제로 존재하지 않는 페이지 상태를 전제로 다음 행동을 선택합니다.
  • 피드백은 실제 결과를 반영해야 한다: 한 사례에서는 iframe 내부 클릭이 성공했지만 하네스가 변화가 없다고 보고했습니다. 모델은 그 결과 유효한 경로를 포기했습니다.
  • 관찰은 정적 스크린샷 이상이어야 한다: 어떤 값은 마우스를 올렸을 때만 나타납니다. 순간적인 상태를 포착하지 못하는 관찰 계층은 작업에 필요한 정보를 모델에게 숨길 수 있습니다.

WebFovea는 이 네 단계를 각각 보강하고, 에이전트가 규칙과 예산을 벗어나지 않도록 가드레일도 추가했습니다. 네 단계라는 진단 관점은 특정 모델에 종속되지 않지만, 개별 해결책은 모델이나 브라우저 환경에 따라 달라질 수 있습니다.

의미와 영향

이 연구는 웹 에이전트의 신뢰성을 단순한 추론 능력 문제가 아닌 시스템 문제로 바라보게 합니다. 실제 웹사이트에는 서로 다른 동작을 하는 컨트롤, 변하는 레이아웃, 임베디드 콘텐츠가 존재합니다. 중간 계층에서 오류가 발생하면 모델이 올바른 결정을 내렸더라도 추론 실패처럼 보일 수 있습니다.

연구자에게는 오류 원인을 더 정밀하게 분류하고 모델 능력과 도구 체인의 영향을 나눠 평가할 수 있는 틀을 제공합니다. 개발자에게는 좌표 보정, 모델 출력 정제, 동작 실패 감지, iframe 처리, 상태 전환 검증이 중요한 실무 과제로 제시됩니다. 더 큰 멀티모달 모델로 교체하는 것만으로는 충분하지 않습니다. 신뢰할 수 있는 웹 에이전트는 올바른 의도를 세우는 데서 끝나지 않고, 브라우저와의 모든 왕복 과정에서 그 의도를 보존해야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AdvSim2Real, 진화하는 프롬프트 인젝션에 강한 웹 에이전트 훈련
AI 에이전트
cctest.ai
AI 에이전트

AdvSim2Real, 진화하는 프롬프트 인젝션에 강한 웹 에이전트 훈련

웹 에이전트는 제3자가 작성한 페이지를 읽어야 하지만, 같은 페이지에 작업을 가로채는 지시가 삽입될 수 있습니다. AdvSim2Real은 고정된 웹 월드 모델 안에서 과제, 공격자, 에이전트를 함께 진화시킵니다.

더 보기
CCTest · Blog
도구 사용 에이전트는 왜 실패하는가: 증거에서 행동까지의 단절
AI 에이전트
cctest.ai
AI 에이전트

도구 사용 에이전트는 왜 실패하는가: 증거에서 행동까지의 단절

에이전트가 최종적으로 올바른 상태에 도달하더라도, 그 행동이 사전에 확보된 증거에 근거했다고 보기는 어렵습니다. SafeActBench 연구는 실행 전 조사와 의존성이 있는 다단계 작업에서 실패가 집중된다는 점을 보여줍니다.

더 보기
CCTest · Blog
프로액티브 에이전트에 필요한 것은 정확성만이 아니다
AI 에이전트
cctest.ai
AI 에이전트

프로액티브 에이전트에 필요한 것은 정확성만이 아니다

프로액티브 LLM 에이전트는 사용자가 요청하기 전에 유휴 연산을 활용해 필요한 지원을 준비한다. 새로운 연구는 작업 능력, 시간 배분, 신뢰를 3T 원칙으로 정리하고 장기 효과를 평가하는 Proactivity-Gym을 제안했다.

더 보기