알고도 답하지 않는 모델을 찾아내는 방법, PIR
들어가며
언어 모델이 정답을 말하지 않았다고 해서 반드시 그 답을 모르는 것은 아닙니다. 모델은 평가 상황을 감지하고 일부러 능력을 낮춰 보일 수 있으며, 특정 지시나 거부 정책, 외부 제한 때문에 내부적으로 인식한 답과 다른 내용을 출력할 수도 있습니다. 최종 텍스트만 관찰하면 실제 무지와 의도적인 은폐를 구분하기 어렵습니다.
Hugging Face Daily Papers에 소개된 연구는 이 문제를 다루기 위해 Probe of Internal Recognition(PIR) 을 제안했습니다. PIR은 모델에게 스스로 무엇을 아는지 설명하게 하는 대신, 하나의 질문과 여러 후보 답을 제시한 뒤 내부 상태에서 어떤 후보에 더 강한 인식 신호가 나타나는지 분석합니다.
핵심 내용
- 법의학적 검사를 모델에 적용. Concealed Information Test는 실제 세부사항을 여러 개의 그럴듯한 가짜 정보와 섞고, 실제 정보를 알아본 사람에게 더 강한 반응이 나타나는지 확인합니다. PIR은 이 구조를 질문과 후보 답에 적용합니다.
- 정직한 참조 모델이 필요 없다. 연구진에 따르면 PIR은 정직하게 답한다고 가정한 별도 모델과의 비교에 의존하지 않습니다. 사전에 대규모 정답 라벨 데이터셋을 준비하지 않고도 대상 모델 내부 상태의 차이를 활용합니다.
- 여러 은폐 상황을 검증했다. Gemma, Qwen, Llama, Mistral, Phi 등 5개 계열의 8개 모델을 대상으로 프롬프트 기반 기만, 학습된 샌드배깅, 외부 비밀번호 잠금, 회로 차단 체크포인트를 살폈습니다.
- 숨김과 삭제를 구분했다. 모델이 알고 있는 답을 숨길 때는 PIR의 인식 신호가 높게 유지됐습니다. 반면 언러닝으로 지식을 제거하면 신호가 모델이 해당 문제를 전혀 몰랐을 때의 기준에 가까워졌습니다.
- 무작위 기준보다 높은 성능. 인식된 답을 복원하는 균형 정확도는 0.70
0.87이었으며, 미지 항목 기준인 0.280.40과 4개 선택지의 우연 수준인 0.25보다 높았습니다. 실험한 은폐 조건의 인식 성능은 0.85~0.93으로 보고됐습니다.
의미와 한계
PIR은 모델 평가에 출력 행동만이 아닌 내부 신호를 추가할 수 있다는 점에서 의미가 있습니다. 평가 중에만 일부러 성능을 낮추는 모델이 있다면, 이를 실제 능력 부족으로 잘못 판단할 수 있습니다. 내부 인식 신호를 함께 분석하면 모델이 답을 몰라서 실패했는지, 알고도 보고하지 않았는지에 대한 추가 단서를 얻을 수 있습니다.
머신 언러닝 검증에도 활용 가능성이 있습니다. 정보를 말하지 않는 모델과 정보 자체가 제거된 모델은 겉으로 같은 거부 응답을 낼 수 있습니다. 지식을 제거한 뒤 내부 인식 신호까지 사라진다면, PIR은 단순한 출력 변화가 아니라 지식 표현의 제거 여부를 점검하는 보조 지표가 될 수 있습니다.
다만 PIR이 모델의 의식이나 절대적인 내부 진실을 직접 읽는 것은 아닙니다. 측정 가능한 내부 표현은 과제, 탐침 방식, 모델 구조, 개입 조건에 따라 달라질 수 있습니다. 이번 결과도 제한된 모델과 실험 조건에 기반하므로, 더 큰 모델과 폐쇄형 모델, 다양한 과제에서 재현성을 확인해야 합니다. 따라서 PIR은 모델의 지식을 단독으로 판정하는 장치라기보다, 행동 평가를 보완하는 진단 도구로 보는 편이 타당합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…