아티클 목록으로
모델 평가

SWE-bench Science가 드러낸 과학 소프트웨어 코드 수정의 난점

약 4분 소요

서론

일반적인 소프트웨어에서 버그 수정은 프로그램이 예상대로 동작하도록 만드는 일입니다. 하지만 과학 소프트웨어는 측정 장비, 시뮬레이션, 데이터 분석 파이프라인의 일부로 사용될 수 있습니다. 따라서 작은 구현 오류도 계산 결과를 바꾸고, 실험의 증거와 과학적 결론에 영향을 줄 수 있습니다. SWE-bench Science는 코딩 에이전트가 패치를 만들 수 있는지만 보지 않고, 수정 이후에도 시스템의 과학적 의미를 보존하는지 평가하기 위해 설계됐습니다.

무엇을 평가하나

이 벤치마크는 20개 과학 분야의 98개 GitHub 저장소에서 수집한 119개 과제로 구성됩니다. 과제는 다음 세 가지 유형으로 나뉩니다.

  • 문제 기반 과제: 보고된 결함이나 오류를 재현하고 수정합니다.
  • 전문가 탐색 과제: 분야 지식을 활용해 잠재적인 과학적·알고리즘적 문제를 찾아갑니다.
  • 엔지니어링 통합 과제: 여러 모듈, 인터페이스, 작업 흐름에 수정 사항을 올바르게 연결합니다.

이 구성은 공개 테스트가 통과하는지만 확인하는 평가보다 넓은 범위를 다룹니다. 논문에 따르면 보고된 최고 성능 시스템인 Claude Code와 Opus-5(max)도 Pass@1이 50% 미만이었습니다. 과학 소프트웨어 자동 수정이 일반적인 디버깅보다 훨씬 복잡하다는 의미입니다.

반복되는 네 가지 실패

연구진은 실패 원인을 네 가지로 정리했습니다. 첫째는 과학 지식의 부족 또는 잘못된 추상화입니다. 에이전트가 문법과 지역적인 제어 흐름을 이해하더라도 물리학, 수학, 방법론에 포함된 제약을 놓칠 수 있습니다. 둘째는 잘못된 탐색이나 표면적인 수정입니다. 눈에 보이는 증상만 바꾸고 근본 원인을 해결하지 않는 경우입니다.

셋째는 수정 범위가 불완전하거나 시스템 통합에 실패하는 문제입니다. 한 부분의 코드는 그럴듯하게 바뀌었지만, 관련 경로와 하위 모듈의 가정이 여전히 맞지 않을 수 있습니다. 넷째는 관찰한 사례에서 얻은 과학적 지식을 새로운 입력과 경계 조건으로 일반화하지 못하는 문제입니다.

프로젝트 설명에 따르면 평가에는 에이전트에게 공개되지 않는 별도의 비공개 테스트가 사용됩니다. 검증기는 새로운 작업 공간에 제출된 패치를 적용한 뒤, 과제의 과학적 동작 계약을 확인합니다. 따라서 공개 어설션을 수정하거나 관찰된 출력을 하드코딩해도 최종 평가를 통과할 수 없습니다. 프로젝트 측은 Qwen3.8-27B가 119개 공개 재현 테스트를 모두 통과했지만, 비공개 평가에서 완전한 Pass@1을 달성한 과제는 35개였다고 설명했습니다.

과학 지식은 양날의 검

연구진은 저장소와 실행 가능한 엔지니어링 환경은 유지하면서 명시적인 과학 가이드를 제거하는 쌍대 소거 실험도 진행했습니다. 결과는 과학 지식이 항상 도움이 되는 것은 아니라는 점을 보여줍니다. 정확하고 과제에 맞는 정보는 탐색 공간을 줄이고 평균 성능과 토큰 효율을 높일 수 있습니다. 반대로 실제 문제와 어긋난 가이드는 에이전트를 잘못된 해석에 고정해 수정 성능을 떨어뜨릴 수 있습니다.

의미와 영향

SWE-bench Science는 평가의 질문을 “실행 가능한 패치를 만들 수 있는가”에서 “복잡한 코드베이스의 과학적 의미를 유지할 수 있는가”로 확장합니다. 앞으로의 연구에서는 분야 추론, 모듈 통합 검증, 보이지 않는 조건에 대한 일반화, 불확실성 공개가 중요해질 것입니다.

Pass@1은 능력의 한 단면일 뿐 과학적 결론에 대한 전문가 검토를 대체하지 않습니다. 신뢰할 수 있는 연구용 코딩 에이전트는 녹색 테스트 결과만 좇지 않고, 계산의 의미와 적용 범위를 확인하며 자신의 가정과 한계를 드러내야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정
모델 평가
cctest.ai
모델 평가

ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정

Hume AI의 연구는 자동 음성 인식 모델이 공개 벤치마크의 정답 문구를 재현하는 경향을 측정하는 방법을 제시했다. 일부 고득점 오픈소스 모델은 음성이 모순되거나 가려졌거나 모호한 상황에서도 참조 문장을 그대로 출력했다.

더 보기
CCTest · Blog
학습은 흔적을 남긴다: 잔차 가중치로 언어 모델 계보 검증
모델 평가
cctest.ai
모델 평가

학습은 흔적을 남긴다: 잔차 가중치로 언어 모델 계보 검증

호환 가능한 언어 모델 체크포인트가 가중치만으로 공통 조상을 드러낼 수 있는지를 검증한 연구가 나왔다. 잔차 구조에서 오해를 부를 수 있는 공유 성분을 제거하고 체크포인트 고유 구조를 비교하는 방식이다.

더 보기