문장은 그럴듯해도 추론은 무너질 수 있다: AI 논문의 ‘과학적 슬롭’
들어가며
AI가 작성한 논문은 문장이 자연스럽고 인용도 실제이며 표와 그림도 그럴듯할 수 있다. 그러나 논문 전체가 과학적으로 타당하다는 뜻은 아니다. 오류가 특정 문장에 드러나는 대신, 연구 질문과 방법론, 실험 결과, 결론 사이의 연결이 약하거나 끊겨 있을 수 있다. 논문 《Science or Slop?》는 이러한 문제를 ‘scientific slop’이라고 부른다.
문장보다 논문 전체를 평가하다
Scientific slop은 명백한 환각과 다르다. 각 부분은 개별적으로 합리적으로 보이지만, 서로 결합했을 때 주장을 뒷받침하지 못하는 것이 핵심이다. 연구진은 이를 측정하기 위해 세 영역에 걸친 여섯 가지 지표를 마련했다.
- 구조: 논문의 각 부분이 연구 목표에 맞게 구성되고 방법, 실험, 결론이 서로 대응하는가.
- 논증: 주장이 결과로 뒷받침되며 추론 과정에 비약이나 모순이 없는가.
- 산출물: 표, 그림, 인용 등 연구 산출물이 본문 설명과 일치하는가.
이를 바탕으로 구축한 SciSlopBench에는 컴퓨터과학 논문이 주로 포함되지만 생명과학, 사회과학, 자연과학 논문도 들어 있다. 총 390편의 AI 생성 논문에는 연구 문제와 기여 유형을 맞춘 인간 작성 논문이 대응된다. 이 벤치마크에서 과학적 슬롭 지표는 AI 논문을 85.9%의 정확도로 식별했다. Binoculars의 정확도는 68.7%였다. 이는 높은 점수가 특정 논문의 AI 생성을 증명한다는 뜻은 아니다. 다만 단어 선택이나 문체보다 과학적 추론의 전역적 불일치가 더 유용한 신호가 될 수 있음을 보여준다.
점수를 직접 낮추면 생기는 문제
연구진은 슬롭을 줄이는 방법도 검토했다. 언어 모델에 지표 점수를 낮추도록 직접 요구하면 겉으로는 점수가 개선되지만, 원래의 논증 문제는 남을 수 있다. 모델이 과학적 근거를 보강하는 대신 평가 기준에만 맞추는 보상 해킹이 발생할 가능성도 있다.
SciSlopHarness는 이 문제를 피하기 위해 실험 기록을 수정의 근거로 사용한다. 근거가 있을 때만 주장이나 설명을 바꾸도록 유도해 점수 자체의 최적화를 막는 방식이다. 논문 요약에 따르면, 인간 참고 논문을 사용하지 않고도 가장 강한 수정 기준선보다 AI 논문과 인간 논문 사이에 남은 격차를 63% 줄였다.
의미와 한계
연구는 과학적 슬롭이 높을수록 ICLR 평가 점수가 낮아지는 경향도 보고한다. 또한 2017년부터 2025년까지 모든 연도에서 채택 논문과 탈락 논문을 우연 이상의 수준으로 구분했다. 이는 심사자들이 명시적인 슬롭 지표를 사용하지 않더라도 논문 전체의 불일치를 감지하고 있을 가능성을 시사한다.
앞으로 학술 AI 평가의 초점은 텍스트가 ‘AI처럼 보이는가’에서 벗어나야 한다. 각 주장이 실제 데이터와 실험으로 뒷받침되는지, 표와 그림이 본문과 일치하는지를 확인해야 한다. SciSlopBench는 이런 방향을 제시하지만, 다양한 학문 분야와 실제 투고 환경에서의 일반화 가능성은 추가 검증이 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…