외부 감독 없는 온폴리시 자기 증류: 모델의 자체 합의로 학습하는 U-OPSD
이 논문은 모델의 여러 생성 결과에서 내부 일관성을 찾아 의사 해답을 만들고, 그 합의와 어긋나는 출력을 학습하는 U-OPSD를 제안한다. 정답 라벨이나 더 큰 교사 모델 없이도 수학 추론 벤치마크에서 기반 모델을 꾸준히 개선했다는 점이 핵심이다.
더 보기이 논문은 모델의 여러 생성 결과에서 내부 일관성을 찾아 의사 해답을 만들고, 그 합의와 어긋나는 출력을 학습하는 U-OPSD를 제안한다. 정답 라벨이나 더 큰 교사 모델 없이도 수학 추론 벤치마크에서 기반 모델을 꾸준히 개선했다는 점이 핵심이다.
더 보기SPOT은 온폴리시 증류에서 어느 위치를 추가로 탐색하고 어떤 후보를 학습 목표로 삼을지 함께 결정한다. 교사 모델의 국소 확률만 따르지 않고, 검증기가 평가한 후속 생성 결과로 증류 타깃을 보정한다.
더 보기이 기술 보고서는 언어모델의 해석 가능성을 학습 이후에 덧붙이는 방식이 아니라, 학습 과정의 제약으로 함께 최적화해야 한다고 주장한다. Steerling-8B는 생성 결과를 입력 토큰, 인간이 이해할 수 있는 개념, 학습 데이터와 연결하려는 사례다.
더 보기Skaling law는 모델 용량과 학습 데이터가 손실에 미치는 영향을 독립적으로 보지 않고, 하나의 상호작용 지수로 결합해 기존 스케일링 법칙의 한계를 보완하려는 제안입니다.
더 보기바이트댄스가 최대 10조 파라미터 규모의 AI 모델을 훈련 중인 것으로 알려졌다. 이는 중국 빅테크가 미국 최상위 연구소와의 격차를 좁히는 수준을 넘어 정면 경쟁에 나섰음을 보여준다.
더 보기GradCuit은 Transformer 중간층에 최적화 가능한 연속 잠재 상태를 삽입해, 생성 결과의 피드백을 내부 추론 상태로 직접 전달하는 방법입니다. 모델 파라미터를 고정한 채 추론 정확도와 안정성을 높이는 데 초점을 둡니다.
더 보기Weak-to-Strong On-Policy Distillation은 더 강한 교사 모델 없이도 강한 LLM을 개선하려는 증류 프레임워크입니다. 작은 모델들의 logit 차이를 이용해 능력 방향을 만들고 이를 학생 모델 학습에 사용합니다.
더 보기Multi-Head Attention Residuals(MHAR)는 Transformer가 깊이 방향의 과거 상태를 읽는 방식을 더 세분화한 제안입니다. 하나의 공유 라우팅 분포 대신 특징 하위공간별 head가 각자 softmax를 갖도록 설계했습니다.
더 보기이 논문은 오프폴리시 응답을 그대로 모방하지 않고, 각 토큰이 올바른지 판단하도록 학습하는 TOPL을 제안한다. 요약과 번역에서 분포 변화에 더 강한 성능을 보였다.
더 보기Hugging Face Daily Papers에 소개된 논문은 MoE 기반 루프형 Transformer 모델군인 Loopie를 제안한다. 저자들은 동일한 사전학습 계산 예산에서 일반 Transformer 기준 모델을 뛰어넘고, 후처리 학습을 통해 강한 추론 능력을 얻었다고 설명한다.
더 보기DeepLoop는 동일한 Transformer 블록을 반복 사용하는 구조에서 기존 잔차 스케일링 규칙이 그대로 맞지 않을 수 있음을 지적합니다. 논문은 명목상 층 수가 아니라 파라미터 방문 횟수와 정렬성을 반영한 스케일링을 제안합니다.
더 보기GigaWorld-Policy-0.5는 World Action Models의 추론 비용 문제를 줄이기 위해, 학습에는 미래 시각 동역학을 활용하고 배포 시에는 행동만 디코딩한다. 혼합 학습, Mixture-of-Transformers, AutoResearch가 핵심 요소다.
더 보기arXiv 논문은 사용자가 LLM의 원래 답변에서 잘못된 추론 단계를 직접 수정하고, 수정된 CoT를 정제된 프롬프트로 바꿔 이후 추론을 유도하는 Deep Interaction을 제안한다.
더 보기이 arXiv 논문은 Transformer 피드포워드 블록의 설계를 깊이가 증가할 때 얼마나 많은 그래디언트 랭크가 살아남는지로 해석한다. 잔차 연결, 정규화 위치, 폭 확장은 단순한 크기 안정화 장치가 아니라 랭크 붕괴를 조절하는 요소로 설명된다.
더 보기DeltaMerge-LowRes는 저자원 언어에서 새 태스크를 수행할 때 필요한 고비용 공동 파인튜닝을 줄이려는 접근이다. 언어 delta와 태스크 delta를 따로 학습한 뒤, 추론 시점에 결합한다.
더 보기