아티클 목록으로
대규모 언어 모델

LLM은 왜 답할 수 없는 질문에도 답하는가: 인식과 거부의 불일치

약 3분 소요

들어가며

모델에게 cot(-540°)를 계산하거나 (1).startswith("1")를 평가하라고 했을 때, 결과가 틀린 이유가 단순한 계산 실수만은 아닐 수 있다. 수학적 정의나 프로그래밍 언어의 의미론에 따르면 입력 자체가 성립하지 않거나, 허용 가능한 답이 존재하지 않을 수 있기 때문이다. 그럼에도 대규모 언어 모델은 종종 완결된 문장과 자신감 있는 어조로 답을 만든다. Hugging Face Daily Papers에 소개된 연구는 이 현상이 문제의 불가능성을 인식하지 못해서인지, 아니면 인식한 신호를 거부 행동으로 전달하지 못해서인지 분석했다.

핵심 발견

  • 모델 내부에는 불가능성 신호가 있다. 연구진은 1.7B에서 70B 규모의 지시 튜닝 모델에서, 답할 수 있는 입력과 구조적으로 불가능한 수학·코드 입력을 구분하는 선형 방향을 찾았다. 생성이 시작되기 전에 모델이 ‘유효한 답이 없다’는 정보를 표현하고 있을 가능성을 보여준다.
  • 인식 방향과 안전 거부 방향은 다르다. 불가능성을 나타내는 방향은 유해 콘텐츠 거부에 관여하는 대표적인 거부 방향과 거의 직교했다. 위험한 요청을 거절할 수 있는 능력이 잘못된 정의나 성립하지 않는 연산을 발견해 멈추는 능력으로 자동 확장되지는 않는다는 뜻이다.
  • 행동 기반 무효성 방향도 완전히 일치하지 않는다. 모델의 무효성 인식 행동을 기준으로 만든 방향은 안전 거부 방향보다 인식 방향에 가까웠다. 그러나 완전한 일치는 아니었다. 내부 판단을 실제 답변으로 바꾸는 별도의 변환 과정이 남아 있을 수 있다.
  • 활성 조정이 행동을 바꾼다. 생성 단계에서 인식 방향으로 개입하면 무효한 수학·코드 입력에 대한 행동이 개입 방향과 강도에 따라 양방향으로 변했다. 무작위 방향에서는 같은 패턴이 나타나지 않아, 해당 신호가 실제 기능을 갖는다는 해석을 뒷받침한다.
  • 불일치는 지시 튜닝만의 결과가 아니다. 베이스 모델과 지시 모델을 비교한 결과, 낮은 코사인 유사도를 보이는 기하 구조는 사전학습 종료 시점에도 이미 존재했다. 후속 학습이 표현 방식을 바꿀 수는 있지만, 인식과 거부를 하나의 경로로 자동 통합하지는 않는 셈이다.

의미와 영향

이 연구는 모델이 답할 수 없는 질문에 답하는 이유를 다시 보게 한다. 만약 모델에 불가능성 탐지 능력 자체가 없다면 더 많은 데이터, 강한 추론 학습, 더 큰 모델이 우선적인 해법일 것이다. 하지만 모델이 이미 문제를 감지하고도 그 신호를 행동에 반영하지 못한다면, 단순한 규모 확대만으로는 충분하지 않을 수 있다. 구조적 유효성 검사와 거부, 추가 질문, 실패 이유 설명을 명시적으로 연결하는 설계가 필요하다.

평가 방식도 달라져야 한다. 최종 답변의 정답 여부만으로는 모델이 생성 전에 입력의 무효성을 인식했는지 알 수 없다. 잠재적 인식 신호가 존재하는지, 얼마나 안정적인지, 실제 생성에 영향을 미치는지를 분리해 측정해야 한다. 또한 거부를 하나의 통합 능력으로 보는 것도 주의해야 한다. 안전 거부, 수학적 타당성 판단, 코드의 타입·의미 검사에는 서로 다른 내부 경로가 관여할 수 있기 때문이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Qwen3.8-Next 아키텍처 해설: 효율성과 학습 안정성의 동시 설계
대규모 언어 모델
cctest.ai
대규모 언어 모델

Qwen3.8-Next 아키텍처 해설: 효율성과 학습 안정성의 동시 설계

Qwen3.8-Flash-Next는 토큰당 약 60억 개의 파라미터만 활성화하는 1250억 파라미터 희소 MoE 모델입니다. 관련 논문은 모델 성능뿐 아니라 학습·추론 비용과 최적화 안정성을 함께 평가합니다.

더 보기
CCTest · Blog
외부 감독 없는 온폴리시 자기 증류: 모델의 자체 합의로 학습하는 U-OPSD
대규모 언어 모델
cctest.ai
대규모 언어 모델

외부 감독 없는 온폴리시 자기 증류: 모델의 자체 합의로 학습하는 U-OPSD

이 논문은 모델의 여러 생성 결과에서 내부 일관성을 찾아 의사 해답을 만들고, 그 합의와 어긋나는 출력을 학습하는 U-OPSD를 제안한다. 정답 라벨이나 더 큰 교사 모델 없이도 수학 추론 벤치마크에서 기반 모델을 꾸준히 개선했다는 점이 핵심이다.

더 보기
CCTest · Blog
해석 가능성은 성능의 비용일까? Steerling-8B가 제안하는 투명한 언어모델
대규모 언어 모델
cctest.ai
대규모 언어 모델

해석 가능성은 성능의 비용일까? Steerling-8B가 제안하는 투명한 언어모델

이 기술 보고서는 언어모델의 해석 가능성을 학습 이후에 덧붙이는 방식이 아니라, 학습 과정의 제약으로 함께 최적화해야 한다고 주장한다. Steerling-8B는 생성 결과를 입력 토큰, 인간이 이해할 수 있는 개념, 학습 데이터와 연결하려는 사례다.

더 보기