OSWorld-Science, 과학 소프트웨어를 다루는 AI 에이전트를 평가하다
연구용 소프트웨어를 AI가 사용하려면 화면을 보고 버튼을 누르는 능력만으로는 부족합니다. 에이전트는 전문 인터페이스와 용어를 이해하고, 분자나 이미지 같은 과학적 객체를 조작하며, 마지막으로 독립적으로 확인할 수 있는 결과를 만들어야 합니다. OSWorld-Science는 이러한 전체 과정을 평가하기 위해 제안된 벤치마크이자 실행 환경입니다.
과학적 목표를 포함한 작업
OSWorld-Science는 여러 과학 분야와 소프트웨어 구성에 걸친 146개 작업으로 12개 비전 언어 모델을 평가합니다. 대상 워크플로에는 분자 그리기와 역합성, 병리 이미지 분석, 통계 컴퓨팅, 물리 시뮬레이션 등이 포함됩니다. 일반적인 데스크톱 조작의 성공 여부가 아니라, 과학적 목적에 맞춰 일련의 작업을 수행할 수 있는지를 묻는 방식입니다.
작업은 전문가의 제안에서 출발해 사람과 AI가 반복적으로 공동 설계합니다. 이후 과학적 가치와 난이도를 기준으로 선별됩니다. 따라서 연구 소프트웨어의 외형만 흉내 낸 문제가 아니라 실제 연구 목표에 가까운 과제를 만들려는 접근으로 볼 수 있습니다.
클릭 기록보다 결과물을 평가
작업별 실행 기반 평가기는 스크린샷이나 조작 경로만 확인하지 않습니다. 애플리케이션 상태와 에이전트가 실제로 생성한 산출물을 검사합니다. 예를 들면 다음과 같습니다.
- 요구 조건에 맞는 분자 구조
- 병리 이미지 분할 마스크
- 통계 분석에서 나온 플롯
- 계산 또는 시뮬레이션의 수치 결과
워크플로를 일부만 완료한 경우에도 부분 점수를 줄 수 있습니다. 이를 통해 지시 이해, 소프트웨어 조작, 최종 결과 생성 중 어느 단계에서 문제가 발생했는지 더 세밀하게 분석할 수 있습니다. 모든 실패를 단순한 성공과 실패로만 분류하지 않는다는 점도 중요합니다.
모델과 실행 하니스를 함께 본다
연구진은 모델 어댑터, 상호작용 루프 제어, 궤적 기록을 결합한 에이전트 하니스도 제공합니다. 이 구조는 모델 간 비교뿐 아니라 실행 시스템의 영향도 분석할 수 있게 합니다. 계획 수립 방식, 조작을 계속할지 결정하는 방법, 문맥을 관리하는 방식이 최종 성능을 바꿀 수 있기 때문입니다.
공개된 결과에 따르면 강력한 하니스를 사용하더라도 현재의 최신 VLM은 중요한 과학 작업에서 여전히 어려움을 겪습니다. 연구는 다언어 입력, 추론 투입량, 컨텍스트 길이 등의 요인도 분석합니다. 다만 제공된 자료에는 모델별 상세 점수와 작업별 실패 사례가 포함되어 있지 않으므로, 특정 과학 분야에서 어떤 모델이 가장 우수한지까지 판단할 수는 없습니다.
의미와 한계
OSWorld-Science의 핵심 의의는 전문가가 정의한 과학적 목표, 소프트웨어 실행, 검증 가능한 산출물을 하나의 평가 흐름으로 연결한 데 있습니다. 과학 에이전트는 인터페이스를 탐색하는 능력뿐 아니라, 만들어 낸 구조·마스크·플롯·수치가 실제 목표를 충족하는지도 평가받아야 합니다.
앞으로 현실적인 작업과 신뢰도 높은 평가기가 추가된다면, 범용 컴퓨터 사용과 실제 연구를 지원하는 에이전트 사이의 간극을 더 정확히 측정할 수 있을 것입니다. 현재로서는 과학 소프트웨어 환경에서 모델 능력과 하니스 설계를 함께 연구할 수 있는 기반을 제공한다는 점이 가장 큰 가치입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…