아티클 목록으로
강화학습

추론 모델에게 ‘언제 멈출지’ 가르치기

약 3분 소요

대형 추론 모델의 핵심 능력은 정답을 만들어내는 데서 끝나지 않는다. 주어진 정보만으로 답을 정당화할 수 있는지, 그리고 답하지 않는 편이 나은지를 판단하는 능력도 중요하다. arXiv에 공개된 한 연구는 정보가 부족한 과제에서 모델이 불필요하게 긴 추론을 수행하는 문제를 분석했다.

인간과 다른 계산 사용 방식

연구진은 모델의 행동을 인간 대상 연구 결과와 비교했다. 인간은 문제를 풀기에 필요한 정보가 없다는 사실을 파악하면 추론에 투입하는 노력을 제한하는 경향이 있다. 해결할 수 없는 문제를 계속 탐색해도 얻을 것이 적기 때문이다.

반면 대형 추론 모델은 답할 수 없는 프롬프트에서도 긴 Chain of Thought를 생성하며 답을 찾으려 할 수 있다. 추가로 생각하면 언제든 해결할 수 있다는 식으로 작동하면서, 핵심 전제가 빠진 문제에도 계산 자원을 계속 사용한다. 이는 근거 없는 답변 가능성을 높일 뿐 아니라 추론 지연과 비용도 키운다.

풀 수 있는지 먼저 판단하도록 보상하기

이 문제를 해결하기 위해 연구팀은 인간 인지의 ‘자원 합리성’ 관점에서 접근했다. 과제를 해결하는 데 필요한 정보가 모두 포함됐는지 효율적으로 판단하도록 유도하는 새로운 GRPO 보상을 설계한 것이다. 목표는 무조건 거부 응답을 늘리는 것이 아니라, 깊은 추론을 시작하기 전에 문제의 해결 가능성을 점검하게 만드는 데 있다.

연구진은 여러 4B 규모 추론 모델을 이 보상으로 미세 조정한 뒤 다음 항목을 살폈다.

  • 정보가 부족한 과제를 인식하고 거부할 수 있는가
  • 답할 수 있는 과제의 응답 능력을 유지하는가
  • 판단 과정에서 생성되는 사고 사슬을 줄일 수 있는가

보고된 결과에 따르면 거부 응답 성능은 평균 12.8% 향상됐다. 동시에 해결 가능한 과제에 대한 응답 능력은 유지됐으며, 사고 사슬은 평균 44% 짧아졌다. 이는 더 나은 거부 응답이 반드시 더 긴 사고를 요구하지 않는다는 점을 보여준다. 중요한 것은 해답을 계속 탐색하기 전에 정보가 충분한지 판별하는 것이다.

실제 시스템에 주는 의미

이 연구는 신뢰성과 추론 효율을 함께 최적화해야 한다는 점을 보여준다. 실제 서비스에서는 해결할 수 없는 요청에 대한 장시간 추론을 피함으로써 지연 시간과 계산 비용을 낮출 수 있다. 사용자 입장에서도 근거가 부족한 답을 받는 것보다, 어떤 정보가 더 필요한지 빠르게 안내받는 편이 유용하다.

다만 제공된 자료에서 확인되는 결과는 여러 4B 모델을 대상으로 한 평균 성능이다. 더 큰 모델이나 다른 유형의 과제, 실제 배포 환경에서도 같은 효과가 재현되는지는 아직 제시되지 않았다.

앞으로의 핵심 과제는 진짜로 풀 수 없는 질문과 더 깊은 추론이 필요한 질문을 구분하는 일이다. 멈추도록 지나치게 강하게 보상하면 답할 수 있는 질문까지 거부할 수 있다. 따라서 좋은 추론 능력은 오래 생각하는 능력뿐 아니라, 더 생각해도 이득이 없을 때 중단하는 능력까지 포함해야 한다.

arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물