ExplorationBench, ‘외계 세계’에서 AI의 탐색 능력을 측정하다
들어가며
과학적 발견은 이미 알려진 문제의 정답을 찾는 데서 끝나지 않는다. 기존 지식이 통하지 않는 상황에서 시스템은 가설을 세우고, 실험을 설계하며, 결과를 해석한 뒤 자신의 이해를 수정해야 한다. 하지만 이 능력을 평가하는 일은 쉽지 않다. 어떤 답이 맞더라도 그것이 실제 탐색의 결과인지, 사전학습 데이터에서 비슷한 지식을 회상한 것인지 구분하기 어렵기 때문이다.
ExplorationBench는 이 문제를 실행 가능한 ‘외계 세계’라는 통제된 환경으로 옮겼다. 세계의 규칙은 프로그램으로 검증할 수 있지만, 익숙한 지식과 의도적으로 충돌하도록 설계돼 기억만으로는 해결하기 어렵다.
벤치마크의 구성
벤치마크에는 AlienCode와 AlienLogic라는 두 개의 샌드박스가 있다. 시스템은 처음부터 완전하고 정확한 규칙을 받지 않는다. 탐색 과정에서 환경과 상호작용하고, 관찰된 결과를 바탕으로 규칙을 추론한 다음 탐색 단계에서 보지 못한 과제를 해결해야 한다.
핵심 설계는 다음과 같다.
- 정확한 검증: 세계의 규칙이 실행 가능하므로 제출한 답을 실제 규칙과 비교해 판정할 수 있다.
- 상식 의존성 제한: 규칙이 일반적인 지식과 어긋나기 때문에 보통의 프로그래밍이나 논리 지식만으로는 충분하지 않다.
- 불완전한 정보 제공: 시스템은 결함이 있는 매뉴얼, 과제별 환경 피드백, 전용 도구 호출 형식을 사용한다. 어떤 설명을 믿고 무엇을 실험할지 스스로 판단해야 한다.
- 탐색 후 전이 평가: 보류 과제를 통해 시스템이 사례를 외운 것이 아니라 재사용 가능한 규칙을 학습했는지 확인한다.
평가 결과
연구진은 10개 AI 시스템을 평가했다. 성능이 높은 시스템은 상호작용을 통해 낯선 규칙을 습득하고, 이를 이후 과제에 적용할 수 있었다. 이는 모델이 기존 정보를 회상하는 데 그치지 않고, 제한된 환경 안에서 새로운 세계 모델을 구성할 가능성을 보여준다.
그러나 탐색은 안정적이고 직선적인 개선 과정이 아니었다. 같은 시스템이라도 어떤 순서로 실험했는지에 따라 성능이 크게 달라졌다. 탐색을 더 오래 지속한다고 해서 항상 결과가 좋아지는 것도 아니었다. 추가 상호작용이 정체로 이어지거나, 앞서 얻은 성과를 되돌리는 경우도 있었다. 따라서 탐색 횟수보다 중요한 것은 증거를 선별하고, 가설을 갱신하며, 언제 탐색을 멈출지 결정하는 능력이다.
의미와 한계
ExplorationBench의 가장 큰 의미는 ‘AI가 발견할 수 있는가’라는 추상적인 질문을 반복 가능한 실험으로 바꿨다는 점이다. 실행 가능한 규칙은 정답 검증을 가능하게 하고, 탐색 단계와 미지 과제를 분리하는 구조는 새롭게 습득한 지식의 전이를 측정하게 한다.
물론 가상 샌드박스가 실제 과학 연구를 모두 재현하는 것은 아니다. 현실의 연구에는 측정 잡음, 제한된 자원, 전문 지식, 긴 피드백 주기가 존재한다. 그럼에도 이 벤치마크는 AI가 미지의 환경에서 어떤 실험을 선택하고, 상충하는 정보를 어떻게 처리하며, 언제 탐색을 종료해야 하는지를 연구할 수 있는 기반을 제공한다.
결국 AI 평가는 모델이 이미 얼마나 많이 아는지뿐 아니라, 한 번도 배운 적 없는 규칙을 얼마나 안정적으로 배울 수 있는지도 다뤄야 한다. ExplorationBench는 그 능력을 비교 가능한 형태로 드러내려는 초기 시도다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…