아티클 목록으로
강화학습

정답 라벨 없이 추론을 개선하는 TTPO, 합의와 불일치를 나눠 학습하다

약 3분 소요

들어가며

대규모 언어 모델의 수학 추론 능력은 강화학습과 온폴리시 자기 증류 같은 사후 학습 기법을 통해 빠르게 향상됐다. 하지만 이런 방법은 대개 정답 라벨이나 검증 가능한 보상을 필요로 한다. 새로운 문제를 푸는 테스트 시 학습에서는 모델이 입력만 받고 정답을 알 수 없기 때문에, 이 의존성이 적용 범위를 제한한다.

논문 ‘TTPO: Test-Time Policy Optimization’은 이 문제를 정답 라벨 없이 다루는 프레임워크를 제안한다. 모델은 같은 문제에 대해 여러 추론 롤아웃을 생성하고, 다수결로 임시 답을 만든다. 이후 각 롤아웃이 다수결 결과와 일치하는지 여부에 따라 서로 다른 최적화 경로로 보낸다.

핵심 내용

  • 다수결을 절대적인 정답으로 취급하지 않는다. 다수결 자체가 틀렸는데 이를 모든 토큰의 교사 신호로 사용하면, 잘못된 답과 추론이 전체 학습 과정에 퍼질 수 있다.
  • 일치와 불일치를 비대칭적으로 처리한다. 의사 라벨과 일치하는 롤아웃은 온폴리시 자기 증류(OPSD)로 학습하고, 불일치하는 롤아웃은 그룹화 강화학습의 대상이 되어 페널티를 받는다.
  • 불일치도 유용한 오류 신호가 될 수 있다. 논문의 관찰에 따르면 다수결이 맞는지와 관계없이, 다수결에서 벗어난 롤아웃은 대체로 틀릴 가능성이 높다. 따라서 의사 라벨이 항상 맞다고 가정하지 않아도 불일치를 부정적 학습 신호로 활용할 수 있다.
  • 토큰 단위로 학습 신호를 고른다. 증류 분기에서는 이미 안정된 위치의 가중치를 낮추고, 강화학습 분기에서는 모델이 높은 확신을 보인 오류에 집중한다.
  • 모델이 좋아질수록 자기 감독도 정교해진다. 롤아웃의 품질이 높아지면 다수결이 더 안정되고, 두 학습 분기로 데이터를 나누는 과정도 개선될 수 있다.

결과와 의미

논문 초록에 따르면 TTPO는 라벨을 사용하지 않고 5개 경쟁 수준 수학 벤치마크에서 라벨 지도 OPSD와 비슷한 성능을 보였다. 테스트 시 학습 실험에서는 Qwen3-1.7B의 성능을 38.0%에서 45.2%로 끌어올렸다고 보고한다. 사고 과정을 사용하지 않는 설정에서는 25.2%에서 36.4%의 향상 폭도 제시했으며, 과제 간 일반화 성능도 확인했다고 설명한다.

TTPO의 핵심은 정답 라벨을 단순히 다수결 의사 라벨로 교체한 데 있지 않다. 다수결에 동의하는 궤적과 동의하지 않는 궤적이 제공하는 정보를 서로 다르게 해석한 점이 중요하다. 전자는 교사 데이터로, 후자는 오류 후보로 활용함으로써 잘못된 투표가 모든 토큰을 한 방향으로 이끄는 문제를 완화하려는 것이다.

이 설계는 모델이 스스로 생성한 결과에서 테스트 시 적응을 위한 신호를 만드는 연구 방향을 보여준다. 다만 다수결을 위해 여러 번 생성해야 하므로 계산 비용이 발생하고, 투표 품질이 학습 순환에 영향을 줄 수 있다. 제공된 자료만으로는 장기 안정성이나 더 넓은 작업에서의 효율을 단정하기 어렵다. 따라서 TTPO는 테스트 시 학습을 완전히 해결한 방법이라기보다, 라벨 없는 추론 개선을 위한 유망한 최적화 프레임워크로 보는 편이 적절하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Co-RL, 다양한 AI 집단의 협력으로 비지도 추론을 학습하다
강화학습
cctest.ai
강화학습

Co-RL, 다양한 AI 집단의 협력으로 비지도 추론을 학습하다

Co-RL은 파라미터를 공유하지 않는 여러 모델이 서로의 피드백에서 보상을 얻도록 하는 다중 에이전트 강화학습 프레임워크입니다. 정답 라벨 없이도 텍스트와 멀티모달 추론 성능을 높이고 자기 보상 학습의 붕괴 위험을 완화합니다.

더 보기
CCTest · Blog
Agent Lightning v1.0, 에이전트 하니스를 강화학습에 연결하다
강화학습
cctest.ai
강화학습

Agent Lightning v1.0, 에이전트 하니스를 강화학습에 연결하다

Agent Lightning v1.0은 도구 호출과 컨텍스트, 제어 흐름을 관리하는 배포 시점의 에이전트 하니스를 모델 후학습에 직접 참여시키는 방식을 제안한다. 6,000개 학습 예제와 비교적 적은 컴퓨팅으로 Qwen3.5-9B의 SWE-bench Verified 점수를 41.8%에서 56.4%로 높였다.

더 보기