코드를 보여주지 않아도 모델 간 코딩 능력 전이가 가능할까
들어가며
코드를 한 번도 보지 않은 모델이 다른 모델에게서 코딩 능력을 배울 수 있을까요? 베이징대학교 연구진은 정교하게 설계된 실험 조건에서 가능성이 있다고 보고했습니다. 핵심은 후속 학습이 목표 작업과 무관해 보이는 출력에도 아주 미세한 흔적을 남길 수 있다는 점입니다.
연구진은 ‘Active Taskless Distillation(ATD)’이라는 방법을 제안했습니다. 코딩 문제를 교사 모델에 풀게 하는 대신, 관련 없는 문맥에서 일반적인 두 단어 중 어느 쪽을 선택하는지 관찰합니다. 먼저 교사와 학생이 공유하는 기반 모델이 두 단어 사이에서 거의 선호를 보이지 않는 프롬프트를 찾습니다. 이어 후속 학습을 거친 교사가 선택한 단어와 프롬프트의 조합만을, 같은 기반 모델에서 시작한 학생 모델에 학습시킵니다.
핵심 결과
- 감독 신호는 단어 하나입니다. 학생 모델은 코드, 목표 작업 예시, 교사의 파라미터, 전체 logits를 받지 않습니다.
- 거의 동률인 선택을 활용합니다. 기반 모델이 두 선택지 사이에서 망설이는 지점에서는 후속 학습이 만든 작은 확률 변화가 더 잘 드러납니다.
- 코딩 평가가 상승했습니다. Qwen2.5-1.5B의 주요 실험에서 5,664개의 단어 수준 데이터는 잡음을 엄격하게 맞춘 대조군보다 HumanEval+ 점수를 5.34%포인트 높였습니다.
- 코드에만 한정되지 않습니다. 과학 지식, 상식 추론, 독해에서도 전이가 보고됐고, 여러 모델 규모와 모델 계열에서 비슷한 현상이 관찰됐습니다.
- 다른 능력과 결합될 수 있습니다. 기능 분석은 학습된 변화가 다른 능력과 조합될 수 있으며, 교사 모델의 업데이트가 클수록 전이 강도도 커지는 경향을 시사합니다.
의미와 한계
이번 연구는 무관한 생성물을 통해 특성이나 선호가 전달될 수 있다는 기존의 ‘잠재적 학습’ 연구를 능력 전이로 확장합니다. 단어 하나만 보면 정보량은 매우 적지만, 의도적으로 선별된 수천 개의 선택은 모델 업데이트 방향에 대한 흔적을 함께 담을 수 있습니다.
모델 개발자에게는 목표 벤치마크만으로 후속 학습을 평가해서는 안 된다는 시사점이 있습니다. 학습 전후의 무관한 프롬프트 반응도 비교해야 할 수 있습니다. 안전성과 거버넌스 측면에서는 작업과 무관해 보이는 저대역폭 출력만으로 능력이 간접적으로 추출되거나 전달될 수 있는지도 새로운 연구 과제가 됩니다.
다만 제공된 자료만으로는 더 큰 모델, 다른 학습 방식, 적대적 환경에서도 효과가 안정적으로 유지되는지 판단하기 어렵습니다. 따라서 ATD는 특정 작업 데이터를 대체하는 일반적인 학습법이라기보다, 후속 학습이 남기는 ‘행동의 그림자’를 탐색하는 실험 도구로 보는 편이 정확합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…