아티클 목록으로
모델 평가

모델 행동에서 데이터 출처로: 합성 사전학습으로 귀속 검증

약 3분 소요

서론

훈련 데이터 귀속은 모델의 특정 능력이나 예측을 어떤 훈련 예제가 형성했는지 찾으려는 분야다. 그러나 실제 파운데이션 모델에서는 이러한 주장을 인과적으로 검증하기가 어렵다. 특정 데이터만 제거한 뒤 모델을 다시 학습하기가 비용상 부담스럽고, 개별 데이터가 어떤 생성 과정을 거쳤는지도 완전히 알기 어렵기 때문이다. 이번 연구는 통제된 합성 사전학습 환경을 이용하면 데이터 귀속을 실험적으로 검증할 수 있다고 제안한다.

연구 설계

연구의 기반은 표 형식 파운데이션 모델용 합성 태스크 생성기 O'PRIOR다. 각 사전학습 태스크에는 구조적 메커니즘, 결측 방식, 교란, 지름길 신호, 분포 이동에 관한 명시적 계보 정보가 포함된다. 생성 단계에서 이러한 속성을 알고 있으므로, 귀속 모델이 선택한 태스크와 실제 데이터 생성 메커니즘을 비교할 수 있다.

연구진은 세 가지 실험을 결합했다.

  • 행동 조건부 귀속: 목표 태스크의 모델 성능과 관련 있을 가능성이 높은 사전학습 태스크를 순위화한다.
  • 반사실적 재학습: 귀속 순위가 높은 태스크나 낮은 태스크를 제거한 뒤 모델을 다시 학습한다.
  • 계보 기반 개입: 지름길과 같은 특정 메커니즘과 연결된 태스크를 선택적으로 제거한다.

핵심 결과

보류된 실제 태스크에서 귀속 순위 상위 5%의 합성 태스크를 제거하자 평균 ROC-AUC가 0.013 하락했다. 같은 비율을 무작위로 제거했을 때의 변화는 0.002±0.004였다. 반대로 하위 태스크를 제거하면 성능이 0.003 향상됐다. 이는 귀속 순위가 단순한 무작위 상관이 아니라, 재학습 후 성능에 영향을 줄 수 있는 데이터와 어느 정도 연결돼 있음을 시사한다.

지름길 계보를 가진 태스크만 놓고 보면, 표적 제거의 효과는 0.043으로 매칭된 무작위 제거의 0.016보다 컸다. 다만 계보를 구분하는 순위 AUROC는 0.55~0.62로 높지 않았다. 데이터 생성 출처가 비슷한 태스크가 반드시 모델 행동에 같은 정도의 영향을 주는 것은 아니라는 뜻이다.

의미와 한계

이 연구의 핵심 기여는 데이터 귀속을 단순한 검색 또는 분류 문제로 보지 않고, 제거와 재학습을 통한 개입 문제로 평가하는 틀을 제시한 데 있다. 표 형식 파운데이션 모델과 합성 데이터 파이프라인에서는 유해한 지름길, 분포 이동과 관련된 태스크를 찾아내고 데이터 정제 우선순위를 정하는 데 활용할 수 있다.

다만 실험은 계보가 명시된 합성 태스크를 기반으로 한다. 복잡하고 출처가 불완전한 실제 대규모 사전학습 데이터에도 같은 결과가 적용되는지는 아직 확인되지 않았다. 중요한 교훈은 데이터가 무엇과 비슷한지와 데이터가 모델에 무엇을 일으키는지는 별개의 질문이라는 점이다. 신뢰할 수 있는 귀속은 두 측면을 모두 개입 실험으로 확인해야 한다.

arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
HyperBrowseComp, 다국어·멀티모달 웹 브라우징 에이전트를 시험하다
모델 평가
cctest.ai
모델 평가

HyperBrowseComp, 다국어·멀티모달 웹 브라우징 에이전트를 시험하다

HyperBrowseComp는 웹 브라우징 에이전트를 위한 고난도 평가 벤치마크다. 13개 언어와 다양한 증거 형식을 대상으로, 단순 검색이 아니라 흩어진 단서를 발견하고 연결하며 검증하는 능력을 측정한다.

더 보기
CCTest · Blog
ArrivalBench: 한 번은 통과한 에이전트 데이터 파이프라인의 시간적 실패
모델 평가
cctest.ai
모델 평가

ArrivalBench: 한 번은 통과한 에이전트 데이터 파이프라인의 시간적 실패

ArrivalBench는 고정 스냅샷에서 한 번 올바르게 실행된 데이터 파이프라인도 지연·중복·순서 뒤섞임·재시도 데이터를 만나면 잘못된 상태를 남길 수 있음을 보여준다. 재현 가능한 전달 순서로 재실행해야 기존 평가가 놓친 문제를 확인할 수 있다.

더 보기