아티클 목록으로
모델 평가

모델이 자신의 출력에서 배우면 왜 불안정해지는가

약 3분 소요

들어가며

테스트 시 학습(Test-Time Training, TTT)은 모델이 추론하는 동안 가중치를 업데이트해 현재 입력에서 얻은 정보를 모델 내부에 저장하려는 접근이다. 긴 컨텍스트에 적응하거나 지속적으로 변화하는 입력을 처리하는 데 유용할 수 있지만, 학습 데이터가 모델 자신의 출력에서 만들어질 때 새로운 위험이 생긴다. 업데이트는 학습 모델만 바꾸는 것이 아니라 다음 학습 샘플을 생성하는 모델도 바꾸기 때문이다.

‘Self-Generated Feedback Destabilizes Test-Time Training’은 이 자기참조적 고리를 최대 128K 토큰 스트림에서 분석했다. 연구진은 여러 TTT-E2E 모델 설정을 평가했고, Qwen3-4B의 기존 가중치에 Adam 업데이트를 적용하는 조건도 별도로 살펴봤다.

핵심 결과

  • 생성 텍스트 자체가 문제의 전부는 아니다. 사람이 작성한 실제 텍스트를 사용한 동일한 업데이트 방식은 성능을 개선할 수 있었다. 반면 모델 자신의 생성 텍스트에서 얻은 업데이트를 계속 보존하면, 독립적인 실제 텍스트에 대한 예측이 악화됐다.
  • 변하는 생성기가 피드백을 만든다. 학습 텍스트를 생성하는 모델을 고정하고 다른 모델만 업데이트하자 125M과 760M 설정에서 손상의 98% 이상이 사라졌다. 핵심 원인은 생성 텍스트라는 형식보다 생성기와 학습기가 함께 변하는 폐쇄 루프에 가까웠다.
  • 원본 적합도와 일반화가 충돌할 수 있다. 한 번의 업데이트를 짝지어 비교한 결과, 업데이트된 모델은 학습 출처가 된 구간을 더 잘 예측했지만 새로운 실제 텍스트는 더 못 예측했다. 따라서 학습 원본의 손실 감소만으로 적응의 성공을 판단할 수 없다.
  • 큰 실패는 일부 경로에 집중된다. 폐쇄 루프 적응이 진행될수록 비용이 커졌지만, 심각한 성능 저하의 대부분은 소수의 궤적에서 발생했다. 평균 지표만 보면 드물지만 큰 불안정성을 놓칠 수 있다는 뜻이다.

업데이트를 확정하기 전 검증

연구진은 ‘Settlement’라는 방식을 평가했다. 후보 상태를 즉시 채택하지 않고 독립적인 실제 텍스트에서 예측 성능을 확인한 뒤, 외부 평가를 통과한 업데이트만 확정하는 방식이다. 125M과 760M 설정에서 이 방법은 최종 평균 격차를 각각 0.07과 -0.02 nats로 유지하면서 실제 텍스트에 대한 적응 효과도 보존했다.

의미와 영향

이 결과는 온라인 적응 시스템의 업데이트를 업데이트를 만든 데이터만으로 평가해서는 안 된다는 원칙을 보여준다. 긴 컨텍스트 모델, 스트리밍 학습기, 자율 에이전트가 추론 중 가중치를 지속적으로 수정한다면 검증, 거부, 롤백 절차를 설계에 포함해야 한다.

이번 연구는 모든 자기 생성 데이터가 반드시 해롭다고 말하지 않는다. 대신 국소적으로는 유효한 업데이트라도 생성기와 학습기의 폐쇄 루프가 길어지면 외부 데이터와의 차이를 점점 키울 수 있음을 보여준다. 앞으로는 적응 속도를 크게 희생하지 않으면서 독립 검증 비용을 낮추고, 불안정한 경로를 조기에 발견하는 방법이 중요해질 전망이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
SWE-Game, 코딩 에이전트의 게임 개발 능력을 검증하다
모델 평가
cctest.ai
모델 평가

SWE-Game, 코딩 에이전트의 게임 개발 능력을 검증하다

SWE-Game은 게임 구현부터 오류 수정과 엔진 간 포팅까지 247개 과제로 코딩 에이전트를 평가하는 벤치마크입니다. 결과는 에이전트가 플레이 가능한 프로토타입을 만들 수 있지만, 요구사항 누락과 게임 로직 오류가 여전히 큰 과제임을 보여줍니다.

더 보기
CCTest · Blog
읽을 수 있는 것만으로는 부족하다: UltraText Bench가 검증한 이미지 생성의 텍스트 정확도
모델 평가
cctest.ai
모델 평가

읽을 수 있는 것만으로는 부족하다: UltraText Bench가 검증한 이미지 생성의 텍스트 정확도

UltraText Bench는 영어와 중국어의 밀집된 시각 텍스트를 대상으로 이미지 생성 모델을 여러 영역과 난이도에서 평가하는 벤치마크입니다. 텍스트의 선명도와 요청한 내용을 정확히 재현하는 능력은 서로 다를 수 있다는 점을 보여줍니다.

더 보기