아티클 목록으로
대규모 언어 모델

다국어 데이터 혼합으로 사용자 언어 안에서 추론하는 모델

약 3분 소요

들어가며

다국어 모델은 한국어나 중국어로 입력된 질문을 이해하더라도, 실제 추론 과정에서는 영어를 사용한 뒤 마지막 답변만 입력 언어로 바꾸는 경우가 있다. 최종 정답만 평가하면 이런 현상은 잘 드러나지 않는다. 그러나 사용자의 의도를 미세하게 반영하기 어렵고, 특정 언어와 문화권에서 더 자연스럽게 표현되는 지식이나 맥락을 놓칠 수 있다는 문제가 있다.

Cohere Labs의 연구는 이 문제를 L2 reasoning이라는 개념으로 다룬다. 이는 모델이 프롬프트에 사용된 언어를 유지하면서 일관되게 추론하는 능력을 뜻한다. 연구진은 단순히 더 큰 모델을 만드는 대신, 지도 미세 조정(SFT)에서 어떤 데이터를 얼마나 섞고 어떤 순서로 학습할지에 초점을 맞췄다. 모든 언어에 충분한 추론 예시가 필요한지, 아니면 데이터 설계를 통해 추론 행동을 여러 언어로 옮길 수 있는지를 검토한 것이다.

핵심 내용

  • 모델과 평가 범위: 3.35B 파라미터의 Tiny Aya L2-Thinker를 구축하고 수학, 상식 추론, 지시 따르기, 개방형 생성, 문화적 추론 등을 포함한 여섯 영역에서 평가했다.
  • 언어 내 추론 비율: 연구 초록에 따르면 60개 언어에서 93%를 넘는 언어 내 추론 비율을 달성하면서도 전반적인 과제 성능을 유지했다. 이는 정답 여부뿐 아니라 추론이 입력 언어로 진행되는지도 보는 결과다.
  • 언어 범위 확대의 중요성: 각 언어에 완전한 추론 감독 데이터를 따로 구축하는 것보다, 학습 데이터가 더 넓은 언어를 포함하도록 만드는 것이 중요하다는 결론을 제시한다.
  • 비추론 데이터의 기여: 명시적인 사고 과정이 없는 일반 다국어 데이터도 언어 표현 능력과 과제 적응을 돕는다. 추론 데이터만으로 다국어 추론을 해결할 필요는 없다는 뜻이다.
  • 영어 추론 기반의 역할: 영어 추론 데이터를 버리는 것이 아니라, 충분히 강한 영어 추론 기반을 다국어 데이터와 결합해 다른 언어로 추론 행동을 전이할 수 있다고 본다.
  • 미학습 언어로의 일반화: 데이터 혼합을 잘 설계하면 추론 감독에서 직접 다루지 않은 언어에도 언어 내 추론이 확장될 가능성이 있다.

의미와 한계

이 연구가 제시하는 방향은 언어별로 대규모 사고 과정 데이터를 반복해서 만드는 방식보다 현실적일 수 있다. 추론에는 언어를 넘어 전이되는 부분이 있으며, 목표 언어로 자연스럽게 표현하는 능력은 일반 다국어 텍스트와 제한적인 다국어 추론 데이터를 함께 학습하면서 형성될 수 있다는 관점이다.

이는 주석 데이터가 부족한 언어에 추론 모델을 적용하는 비용을 낮출 가능성이 있다. 동시에 모델 크기만큼이나 어떤 언어를 데이터에 포함할지, 비추론 텍스트를 얼마나 넣을지, 학습 단계별로 어떤 비율을 적용할지가 중요해진다.

다만 93% 이상이라는 수치를 모든 언어에서 동일한 품질을 보장하는 결과로 해석해서는 안 된다. 언어 내 추론 비율은 사실 정확성, 문화적 적절성, 복잡한 과제에서의 성능과 동일한 지표가 아니다. 제공된 자료에는 언어별 세부 결과가 포함되어 있지 않으므로, 저자원 언어에서도 성능이 균등하다고 단정할 수 없다.

연구팀은 Tiny Aya L2-Thinker와 Tiny Aya En-Thinker의 가중치, 그리고 44개 언어를 포함한 다국어 추론 데이터를 공개했다. 공개 자료는 데이터 혼합 전략을 재현하고, 다양한 언어와 문화적 과제에서 그 효과를 검증하는 출발점이 될 수 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
NCP-ArchPreview, 다음 토큰에서 다음 개념 예측으로 나아가는 언어 모델
대규모 언어 모델
cctest.ai
대규모 언어 모델

NCP-ArchPreview, 다음 토큰에서 다음 개념 예측으로 나아가는 언어 모델

NCP-ArchPreview는 기존의 다음 토큰 예측에 여러 토큰을 아우르는 이산적 다음 개념 예측을 추가한다. 자동회귀 생성을 유지하면서 더 높은 수준의 의미 구조를 잠재 공간에서 학습하려는 접근이다.

더 보기
CCTest · Blog
정답을 모방하는 대신 잘못된 추론을 피하며 LLM을 학습시키다
대규모 언어 모델
cctest.ai
대규모 언어 모델

정답을 모방하는 대신 잘못된 추론을 피하며 LLM을 학습시키다

Negative Self-Distillation은 특권 정보가 반영된 정답 추론을 그대로 모방시키지 않고, 모델이 스스로 만든 결함 있는 추론에서 멀어지도록 학습하는 방법입니다. 외부 라벨 없이 탐색과 자기수정을 보존하는 것이 목표입니다.

더 보기
CCTest · Blog
LLM은 왜 답할 수 없는 질문에도 답하는가: 인식과 거부의 불일치
대규모 언어 모델
cctest.ai
대규모 언어 모델

LLM은 왜 답할 수 없는 질문에도 답하는가: 인식과 거부의 불일치

1.7B부터 70B 규모의 지시 튜닝 모델을 분석한 연구는 모델이 수학·코드 문제의 구조적 불가능성을 생성 전에 인식할 수 있음을 보여준다. 문제의 핵심은 인식 능력의 부재보다, 그 신호를 거부 행동으로 연결하지 못하는 라우팅 실패에 가깝다.

더 보기