아티클 & 가이드

대규모 언어 모델

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 15개의 아티클

CCTest · Blog
외부 감독 없는 온폴리시 자기 증류: 모델의 자체 합의로 학습하는 U-OPSD
대규모 언어 모델
cctest.ai
대규모 언어 모델

외부 감독 없는 온폴리시 자기 증류: 모델의 자체 합의로 학습하는 U-OPSD

이 논문은 모델의 여러 생성 결과에서 내부 일관성을 찾아 의사 해답을 만들고, 그 합의와 어긋나는 출력을 학습하는 U-OPSD를 제안한다. 정답 라벨이나 더 큰 교사 모델 없이도 수학 추론 벤치마크에서 기반 모델을 꾸준히 개선했다는 점이 핵심이다.

더 보기
CCTest · Blog
해석 가능성은 성능의 비용일까? Steerling-8B가 제안하는 투명한 언어모델
대규모 언어 모델
cctest.ai
대규모 언어 모델

해석 가능성은 성능의 비용일까? Steerling-8B가 제안하는 투명한 언어모델

이 기술 보고서는 언어모델의 해석 가능성을 학습 이후에 덧붙이는 방식이 아니라, 학습 과정의 제약으로 함께 최적화해야 한다고 주장한다. Steerling-8B는 생성 결과를 입력 토큰, 인간이 이해할 수 있는 개념, 학습 데이터와 연결하려는 사례다.

더 보기
CCTest · Blog
Skaling Law, 모델 규모와 데이터의 상호작용을 스케일링 법칙에 넣다
대규모 언어 모델
cctest.ai
대규모 언어 모델

Skaling Law, 모델 규모와 데이터의 상호작용을 스케일링 법칙에 넣다

Skaling law는 모델 용량과 학습 데이터가 손실에 미치는 영향을 독립적으로 보지 않고, 하나의 상호작용 지수로 결합해 기존 스케일링 법칙의 한계를 보완하려는 제안입니다.

더 보기
CCTest · Blog
GradCuit: 테스트 시점에 LLM의 내부 추론을 최적화하다
대규모 언어 모델
cctest.ai
대규모 언어 모델

GradCuit: 테스트 시점에 LLM의 내부 추론을 최적화하다

GradCuit은 Transformer 중간층에 최적화 가능한 연속 잠재 상태를 삽입해, 생성 결과의 피드백을 내부 추론 상태로 직접 전달하는 방법입니다. 모델 파라미터를 고정한 채 추론 정확도와 안정성을 높이는 데 초점을 둡니다.

더 보기
CCTest · Blog
Multi-Head Attention Residuals: Transformer 잔차 흐름에 다중 헤드를 더하다
대규모 언어 모델
cctest.ai
대규모 언어 모델

Multi-Head Attention Residuals: Transformer 잔차 흐름에 다중 헤드를 더하다

Multi-Head Attention Residuals(MHAR)는 Transformer가 깊이 방향의 과거 상태를 읽는 방식을 더 세분화한 제안입니다. 하나의 공유 라우팅 분포 대신 특징 하위공간별 head가 각자 softmax를 갖도록 설계했습니다.

더 보기
CCTest · Blog
Loopie, 루프형 Transformer의 가능성을 다시 묻다
대규모 언어 모델
cctest.ai
대규모 언어 모델

Loopie, 루프형 Transformer의 가능성을 다시 묻다

Hugging Face Daily Papers에 소개된 논문은 MoE 기반 루프형 Transformer 모델군인 Loopie를 제안한다. 저자들은 동일한 사전학습 계산 예산에서 일반 Transformer 기준 모델을 뛰어넘고, 후처리 학습을 통해 강한 추론 능력을 얻었다고 설명한다.

더 보기
CCTest · Blog
DeepLoop: 루프형 Transformer의 깊이 확장을 안정화하는 방법
대규모 언어 모델
cctest.ai
대규모 언어 모델

DeepLoop: 루프형 Transformer의 깊이 확장을 안정화하는 방법

DeepLoop는 동일한 Transformer 블록을 반복 사용하는 구조에서 기존 잔차 스케일링 규칙이 그대로 맞지 않을 수 있음을 지적합니다. 논문은 명목상 층 수가 아니라 파라미터 방문 횟수와 정렬성을 반영한 스케일링을 제안합니다.

더 보기
CCTest · Blog
GigaWorld-Policy-0.5: 월드 액션 모델을 더 빠른 로봇 제어로 이끄는 접근
대규모 언어 모델
cctest.ai
대규모 언어 모델

GigaWorld-Policy-0.5: 월드 액션 모델을 더 빠른 로봇 제어로 이끄는 접근

GigaWorld-Policy-0.5는 World Action Models의 추론 비용 문제를 줄이기 위해, 학습에는 미래 시각 동역학을 활용하고 배포 시에는 행동만 디코딩한다. 혼합 학습, Mixture-of-Transformers, AutoResearch가 핵심 요소다.

더 보기
CCTest · Blog
Transformer 깊이를 ‘랭크 보존’ 관점에서 다시 보기
대규모 언어 모델
cctest.ai
대규모 언어 모델

Transformer 깊이를 ‘랭크 보존’ 관점에서 다시 보기

이 arXiv 논문은 Transformer 피드포워드 블록의 설계를 깊이가 증가할 때 얼마나 많은 그래디언트 랭크가 살아남는지로 해석한다. 잔차 연결, 정규화 위치, 폭 확장은 단순한 크기 안정화 장치가 아니라 랭크 붕괴를 조절하는 요소로 설명된다.

더 보기
CCTest · Blog
DeltaMerge-LowRes: 언어 적응과 태스크 적응을 분리한 뒤 가중치 공간에서 결합
대규모 언어 모델
cctest.ai
대규모 언어 모델

DeltaMerge-LowRes: 언어 적응과 태스크 적응을 분리한 뒤 가중치 공간에서 결합

DeltaMerge-LowRes는 저자원 언어에서 새 태스크를 수행할 때 필요한 고비용 공동 파인튜닝을 줄이려는 접근이다. 언어 delta와 태스크 delta를 따로 학습한 뒤, 추론 시점에 결합한다.

더 보기