아티클 & 가이드

강화학습

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 34개의 아티클

CCTest · Blog
OPD²: 추론 튜닝으로 생긴 ‘차이’만 증류하는 방법
강화학습
cctest.ai
강화학습

OPD²: 추론 튜닝으로 생긴 ‘차이’만 증류하는 방법

NAVER AI Lab의 OPD²는 교사 모델의 전체 출력 분포를 그대로 따라 하지 않고, 추론 튜닝된 교사와 원래 베이스 모델 사이의 차이를 증류 신호로 사용한다. 논문은 수학, 과학, 코드 추론 벤치마크에서 기존 on-policy distillation보다 일관된 개선을 보였다고 설명한다.

더 보기
CCTest · Blog
Ring-Zero: 제로 RL을 1조 파라미터로 확장하면 생기는 변화
강화학습
cctest.ai
강화학습

Ring-Zero: 제로 RL을 1조 파라미터로 확장하면 생기는 변화

Ring-Zero는 인간이 주석한 추론 데이터를 쓰지 않고 검증 가능한 보상으로 추론 능력을 끌어내는 zero RL을 1T 파라미터 규모에서 탐구한다. 논문은 대규모화가 샘플 효율과 성능 상한을 높이고, 자기검증 같은 새로운 추론 행동을 만든다고 보고한다.

더 보기
CCTest · Blog
RL 사후학습 계산 자원은 어디에 써야 할까: 모델 크기, 탐색, 학습, 피드백
강화학습
cctest.ai
강화학습

RL 사후학습 계산 자원은 어디에 써야 할까: 모델 크기, 탐색, 학습, 피드백

이 arXiv 논문은 RL 사후학습 비용을 총 FLOPs 하나로 요약하는 관행의 한계를 짚는다. 고정된 예산에서 더 큰 모델, 더 긴 학습, 더 많은 rollout 탐색, 더 강한 보상 피드백 중 무엇에 계산을 배분해야 하는지를 분석한다.

더 보기
CCTest · Blog
Lighthouse RL, ‘좋은 지점’으로 되돌아가 아날로그 회로 최적화 효율 높인다
강화학습
cctest.ai
강화학습

Lighthouse RL, ‘좋은 지점’으로 되돌아가 아날로그 회로 최적화 효율 높인다

새 arXiv 논문은 학습 중 발견한 고성능 회로 설정을 ‘등대’로 저장하고, 이후 강화학습 에피소드의 재시작 지점으로 활용하는 Lighthouse RL을 제안한다. 핵심 목표는 비용이 큰 아날로그 회로 크기 최적화에서 불필요한 탐색을 줄이는 것이다.

더 보기
CCTest · Blog
리아푸노프 지수를 보상으로: 강화학습의 도립진자 안정화 재해석
강화학습
cctest.ai
강화학습

리아푸노프 지수를 보상으로: 강화학습의 도립진자 안정화 재해석

새 arXiv 논문은 수직 운동을 하는 도립진자 안정화 문제에서 리아푸노프 특성 지수를 물리 기반 밀집 보상으로 사용하는 방법을 제안한다. 보고에 따르면 에이전트는 Kapitza 진자의 진동 안정화뿐 아니라 축의 흔들림을 감쇠시켜 엄밀한 직립 상태까지 도달했다.

더 보기
CCTest · Blog
SIVA-RL: 정답을 넘어 시각 증거에 맞추는 멀티모달 강화학습
강화학습
cctest.ai
강화학습

SIVA-RL: 정답을 넘어 시각 증거에 맞추는 멀티모달 강화학습

새 arXiv 논문 SIVA-RL은 이미지 개입의 종류가 아니라 실제 보상 변화에 따라 시각 정렬 신호를 배정한다. 목표는 비전-언어 모델이 답을 맞히는 데서 그치지 않고 이미지 증거에 근거해 추론하도록 만드는 것이다.

더 보기