아티클 & 가이드

강화학습

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 34개의 아티클

CCTest · Blog
정답 라벨 없이 추론을 개선하는 TTPO, 합의와 불일치를 나눠 학습하다
강화학습
cctest.ai
강화학습

정답 라벨 없이 추론을 개선하는 TTPO, 합의와 불일치를 나눠 학습하다

TTPO는 다수결 의사로 만든 의사 라벨을 무조건 정답으로 간주하지 않고, 이에 동의하는 추론과 동의하지 않는 추론에 서로 다른 학습 목표를 적용한다. 이를 통해 잘못된 다수결이 전체 교사 신호를 오염시키는 위험을 줄인다.

더 보기
CCTest · Blog
Co-RL, 다양한 AI 집단의 협력으로 비지도 추론을 학습하다
강화학습
cctest.ai
강화학습

Co-RL, 다양한 AI 집단의 협력으로 비지도 추론을 학습하다

Co-RL은 파라미터를 공유하지 않는 여러 모델이 서로의 피드백에서 보상을 얻도록 하는 다중 에이전트 강화학습 프레임워크입니다. 정답 라벨 없이도 텍스트와 멀티모달 추론 성능을 높이고 자기 보상 학습의 붕괴 위험을 완화합니다.

더 보기
CCTest · Blog
Agent Lightning v1.0, 에이전트 하니스를 강화학습에 연결하다
강화학습
cctest.ai
강화학습

Agent Lightning v1.0, 에이전트 하니스를 강화학습에 연결하다

Agent Lightning v1.0은 도구 호출과 컨텍스트, 제어 흐름을 관리하는 배포 시점의 에이전트 하니스를 모델 후학습에 직접 참여시키는 방식을 제안한다. 6,000개 학습 예제와 비교적 적은 컴퓨팅으로 Qwen3.5-9B의 SWE-bench Verified 점수를 41.8%에서 56.4%로 높였다.

더 보기
CCTest · Blog
DAPD: 정책 증류에서 ‘특권 정보 착각’을 줄이는 방법
강화학습
cctest.ai
강화학습

DAPD: 정책 증류에서 ‘특권 정보 착각’을 줄이는 방법

DAPD 논문은 온폴리시 자기 증류에서 발생하는 성능 저하를 교사와 학생이 접근할 수 있는 정보의 비대칭 문제로 설명합니다. 두 단계의 앵커링을 통해 추론 시 재현할 수 없는 특권 의존 행동이 학생에게 전달되는 것을 줄이려 합니다.

더 보기
CCTest · Blog
SAF-OPD: 강화학습과 온폴리시 증류를 안정적으로 결합하는 방법
강화학습
cctest.ai
강화학습

SAF-OPD: 강화학습과 온폴리시 증류를 안정적으로 결합하는 방법

SAF-OPD는 검증 가능한 보상 기반 강화학습과 온폴리시 증류를 단순히 고정 비율로 섞을 때 발생하는 불안정성을 다룬다. 교사 신호의 크기와 적용 시점을 조절해 탐색 능력을 보존하는 것이 핵심이다.

더 보기
CCTest · Blog
RLSVR: 개방형 LLM 과제를 자기 검증 가능한 강화학습 환경으로
강화학습
cctest.ai
강화학습

RLSVR: 개방형 LLM 과제를 자기 검증 가능한 강화학습 환경으로

이 논문은 수학·코딩처럼 정답 검증이 쉬운 영역에 강했던 RLVR을 개방형 생성 과제로 확장하려 한다. RLSVR은 과제를 변환해 환경 내부 규칙과 상호작용 결과에서 자동으로 보상을 얻는 방식을 제안한다.

더 보기
CCTest · Blog
Molt: 에이전트형 강화학습을 위한 PyTorch 네이티브 훈련 프레임워크
강화학습
cctest.ai
강화학습

Molt: 에이전트형 강화학습을 위한 PyTorch 네이티브 훈련 프레임워크

Molt는 에이전트형 강화학습 연구에서 반복적인 알고리즘 수정과 rollout 변경에 따른 엔지니어링 부담을 줄이기 위해 설계된 PyTorch 네이티브 프레임워크다. 간결한 코드베이스를 유지하면서 비동기 훈련, 멀티모달 정책, MoE 정책을 지원한다.

더 보기
CCTest · Blog
ISO: RLVR 최적화를 ‘스펙트럼 고정, 프레임 학습’으로 재정의하다
강화학습
cctest.ai
강화학습

ISO: RLVR 최적화를 ‘스펙트럼 고정, 프레임 학습’으로 재정의하다

이 논문은 RLVR이 모델의 특이값 스펙트럼을 크게 다시 쓰기보다, 입력·출력 특이 프레임의 변화를 통해 새 능력을 획득한다고 설명한다. 이를 바탕으로 고정 스펙트럼 최적화 스택인 ISO를 제안한다.

더 보기
CCTest · Blog
SAT: 샘플의 오래됨에 맞춰 신뢰 영역을 조정해 비동기 강화학습을 안정화
강화학습
cctest.ai
강화학습

SAT: 샘플의 오래됨에 맞춰 신뢰 영역을 조정해 비동기 강화학습을 안정화

비동기 강화학습은 처리량을 높이지만, rollout을 만든 정책과 학습 시점의 정책 사이에 지연과 불일치가 생긴다. SAT는 이 staleness를 반영해 PPO식 클리핑 구간을 선택적으로 조정한다.

더 보기
CCTest · Blog
Distilled RL: LLM 후학습에 교사 모델의 세밀한 신호를 결합하다
강화학습
cctest.ai
강화학습

Distilled RL: LLM 후학습에 교사 모델의 세밀한 신호를 결합하다

Distilled Reinforcement Learning은 결과 보상에 의존하는 강화학습과 교사 분포를 무조건 모방하는 온라인 증류 사이의 간극을 겨냥한다. 교사 모델의 선호를 토큰 수준의 정책 그래디언트에 선택적으로 반영한다.

더 보기
CCTest · Blog
CPO: 엔트로피를 넘어 정확성 인식 RLVR로 가는 방법
강화학습
cctest.ai
강화학습

CPO: 엔트로피를 넘어 정확성 인식 RLVR로 가는 방법

이 논문은 RLVR에서 흔히 쓰이는 엔트로피 기반 advantage shaping이 유용한 불확실성과 해로운 혼란을 구분하지 못한다는 점을 지적한다. Contrastive Policy Optimization은 참조 유도 생성과 일반 생성의 token 단위 분포 차이를 활용해 더 정확성에 가까운 학습 신호를 만든다.

더 보기