아티클 목록으로
모델 평가

AutoSciBench, 과학 에이전트 평가를 스스로 진화시키다

약 4분 소요

왜 벤치마크를 자동으로 갱신해야 하나

과학 에이전트가 기존 테스트에서 높은 점수를 얻었다고 해서 과학적 추론 능력이 충분히 향상됐다고 단정할 수는 없습니다. 문제 형식과 데이터에 익숙해져 벤치마크가 포화됐을 가능성도 있기 때문입니다. 특히 과학 분야의 평가 과제는 질문만 만들면 끝나지 않습니다. 데이터, 실행 환경, 검증 가능한 정답까지 준비해야 하며, 이를 업데이트하려면 상당한 시간과 전문성이 필요합니다.

Genentech 연구진이 제시한 AutoSciBench는 벤치마크 제작을 일회성 작업이 아니라 반복적인 학습 과정으로 바라봅니다. 시스템이 과제를 만들고 에이전트가 풀면, 풀이 과정과 평가 피드백을 분석해 과제의 허점과 의도하지 않은 지름길을 찾습니다. 이후 같은 과제를 수정하거나 새로운 개념의 과제를 생성합니다.

두 단계로 표현하는 과제

AutoSciBench는 각 과제를 다음 두 계층으로 표현합니다.

  • 상위 개념: 과학 분야, 데이터 양식, 요구되는 추론 접근법을 지정합니다.
  • 하위 레시피: 질문과 환경, 정답을 구성하고 검증하는 구체적인 방법을 정의합니다.

과제가 생성되면 솔버 에이전트가 문제를 풀고 풀이 궤적을 남깁니다. 판정 에이전트의 피드백은 모델이 원자료를 실제로 분석했는지, 아니면 질문의 표면적 단서나 중간 결과에 의존했는지를 점검하는 데 활용됩니다. 시스템은 이에 따라 레시피나 상위 개념을 수정하고, 원자료 재검토, 중간 결과 해석, 여러 증거의 통합을 요구하는 방향으로 과제를 바꿉니다.

또 하나의 특징은 이전 수정 과정에서 얻은 경험을 다음 과제 생성에 재사용한다는 점입니다. 앞선 과제에서 발견된 편법이나 설계 결함이 새로운 개념을 만들 때 반영되므로, 벤치마크가 에이전트의 행동을 관찰하며 점차 방어적으로 변할 수 있습니다.

실험에서 확인된 변화

연구진은 기존 벤치마크를 출발점으로 계산생물학, 재료과학, 임상 영상 세 분야에서 AutoSciBench를 평가했습니다. 초기 생성 과제는 이를 만든 에이전트가 쉽게 풀 수 있을 정도로 단순한 경우도 있었습니다. 그러나 반복적인 수정과 경험 축적을 거치면서 난도가 높아졌고, 특정 솔버 모델에만 어려운 문제가 아니라 다른 모델에도 도전이 되는 과제로 확장됐습니다.

인간이 큐레이션한 벤치마크와 비교했을 때, 생성 벤치마크는 계산생물학에서 평균 솔버 정확도를 22.4%포인트, 재료과학에서 25.5%포인트 낮췄습니다. 또한 세 분야 모두에서 생성 과제가 더 높은 평균 품질 평가를 받았습니다. 이는 자동 생성된 평가 세트가 이미 익숙해진 문제보다 모델의 취약점과 능력 차이를 더 잘 드러낼 가능성을 보여줍니다.

다만 낮은 정확도만으로 과제가 더 과학적으로 가치 있다고 판단할 수는 없습니다. 정답의 타당성, 실행 환경의 재현성, 평가 과정의 편향은 여전히 전문가 검토가 필요합니다.

의미와 남은 과제

AutoSciBench의 핵심 의미는 벤치마크의 수명주기를 바꾸는 데 있습니다. 공개 후 고정되는 문제집이 아니라, 에이전트가 발견한 지름길을 계속 찾아내고 차단하는 평가 시스템을 지향합니다. 과학 AI에서는 단순한 패턴 인식보다 원자료 확인, 결과 해석, 근거 통합이 중요하므로 이런 적응형 평가가 특히 유용할 수 있습니다.

앞으로는 데이터 누수, 판정자 편향, 통제되지 않는 난도 상승, 과학적 결론의 검증 가능성을 해결해야 합니다. 그럼에도 에이전트가 시험을 더 잘 풀수록 시험을 만드는 시스템 역시 학습하고 적응해야 한다는 방향은 분명합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
UndoBench: AI 에이전트는 작업 완료보다 안전한 복구를 평가받아야 한다
모델 평가
cctest.ai
모델 평가

UndoBench: AI 에이전트는 작업 완료보다 안전한 복구를 평가받아야 한다

UndoBench는 도구를 사용하는 AI 에이전트의 정상적인 작업 수행 능력과 장애 이후 안전하게 복구하는 능력을 분리해 평가한다. 실험 결과, 작업을 완료하더라도 중복 외부 효과를 막지 못하는 사례가 상당수 나타났다.

더 보기
CCTest · Blog
LLM 수학 추론의 약점은 계산보다 ‘발견’일 수 있다
모델 평가
cctest.ai
모델 평가

LLM 수학 추론의 약점은 계산보다 ‘발견’일 수 있다

새 연구는 대규모 언어 모델의 수학 추론을 발견, 생성, 이해, 실행의 네 능력으로 나누어 분석한다. 최종 정답률만으로는 모델의 실제 역량 구성을 알기 어렵다고 지적하고, 수학적 프리미티브를 활용한 보완 방법을 제안한다.

더 보기