외부 감독 없는 온폴리시 자기 증류: 모델의 자체 합의로 학습하는 U-OPSD
이 논문은 모델의 여러 생성 결과에서 내부 일관성을 찾아 의사 해답을 만들고, 그 합의와 어긋나는 출력을 학습하는 U-OPSD를 제안한다. 정답 라벨이나 더 큰 교사 모델 없이도 수학 추론 벤치마크에서 기반 모델을 꾸준히 개선했다는 점이 핵심이다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 791개의 아티클
이 논문은 모델의 여러 생성 결과에서 내부 일관성을 찾아 의사 해답을 만들고, 그 합의와 어긋나는 출력을 학습하는 U-OPSD를 제안한다. 정답 라벨이나 더 큰 교사 모델 없이도 수학 추론 벤치마크에서 기반 모델을 꾸준히 개선했다는 점이 핵심이다.
더 보기Motif 3는 총 3140억 파라미터, 토큰당 132억 활성 파라미터를 가진 decoder-only MoE 언어 모델이다. GDLA와 다단계 후학습을 결합해 추론, 코딩, 장문맥 성능을 높이려 한다.
더 보기이미지 생성 대화에서 유용한 후속 편집 제안은 채팅 텍스트만으로 만들 수 없다. 이 연구는 실제 서비스 데이터와 클릭 피드백, 시각 검증기를 결합해 현재 이미지에 맞는 다음 편집 추천을 개선한다.
더 보기이 기술 보고서는 언어모델의 해석 가능성을 학습 이후에 덧붙이는 방식이 아니라, 학습 과정의 제약으로 함께 최적화해야 한다고 주장한다. Steerling-8B는 생성 결과를 입력 토큰, 인간이 이해할 수 있는 개념, 학습 데이터와 연결하려는 사례다.
더 보기AMD는 강한 교사 에이전트의 성공 궤적을 계층적 기억으로 추출해 작은 LLM 에이전트에 전달하는 방식이다. 재학습보다 재사용 가능한 경험을 구조화하는 데 초점을 둔다.
더 보기SPOT은 온폴리시 증류에서 어느 위치를 추가로 탐색하고 어떤 후보를 학습 목표로 삼을지 함께 결정한다. 교사 모델의 국소 확률만 따르지 않고, 검증기가 평가한 후속 생성 결과로 증류 타깃을 보정한다.
더 보기Evidence-RL은 비전-언어 모델이 정답을 맞혔더라도 실제로 이미지의 핵심 증거를 사용했는지 검증하려는 연구다. CED는 증거 영역을 반사실적으로 중화해 답변이 해당 시각 증거에 의존하는지를 훈련 중 감사한다.
더 보기YOLO-PEFT는 실시간 객체 탐지기에서 PEFT 어댑터를 어디에 둘지 결정하는 문제를 감사 가능한 제약 계획으로 바꾼다. 단순히 LoRA를 붙이는 것이 아니라, 위험할 때 훈련 전에 거부하는 절차까지 포함한다.
더 보기이 논문은 Test-Time Training을 개별 변형의 집합이 아니라 조합 가능한 설계 공간으로 다시 정의한다. 핵심은 새 변형을 만들기 쉬워지는 것뿐 아니라, 어떤 구성요소가 실제로 성능에 기여하는지 분리해서 볼 수 있다는 점이다.
더 보기Skaling law는 모델 용량과 학습 데이터가 손실에 미치는 영향을 독립적으로 보지 않고, 하나의 상호작용 지수로 결합해 기존 스케일링 법칙의 한계를 보완하려는 제안입니다.
더 보기AI 중심 헤지펀드 Situational Awareness가 공개시장 포트폴리오 축소 이후에도 칩 제조 스타트업에 대규모 투자를 이어갔다. 이번 투자로 Source Foundry에 대한 누적 투자액은 5억 달러가 됐다.
더 보기Us vs. Them은 버전 이력과 diff를 이용해 현재 텍스트의 어느 구간이 인간이 쓴 부분이고 어느 구간이 에이전트가 만든 부분인지 추정하는 오픈소스 도구다. AI 에이전트가 인간의 의도가 담긴 영역을 함부로 덮어쓰지 않도록 돕는 데 초점이 있다.
더 보기아마존이 텍사스주 Pecos County에 계획 중인 데이터센터를 위해 현장 발전소에 투자하고 있으며, 이 천연가스 발전소는 연간 3300만 톤의 이산화탄소 배출 허가를 받은 것으로 전해졌다.
더 보기OpenAI가 프레젠테이션 생성 스타트업 NextSlide를 인수했다. 거래는 2026년 초에 완료됐으며, NextSlide 팀원들은 현재 ChatGPT 관련 업무를 맡고 있다.
더 보기컴퓨터 사용 에이전트의 성능은 무엇보다도 평가자의 신뢰성에 달려 있습니다. OSReward는 그 평가 문제를 체계적으로 검증하고, 공개 데이터와 오픈 보상 모델까지 제시합니다.
더 보기Kandinsky Lab이 잠재 확산 모델을 위한 KVAE 토크나이저 패밀리를 공개했다. 이 프로젝트는 오디오, 이미지, 비디오를 텍스트 조건 생성에 적합한 잠재 표현으로 압축하는 데 초점을 맞춘다.
더 보기Oracle이 OpenJDK 기여 과정에서 AI가 생성한 코드를 제출하지 못하도록 했다. 다만 개발자가 LLM을 개인적으로 디버깅이나 코드 리뷰 보조에 쓰는 것은 허용된다.
더 보기Cloudflare가 사람 대신 AI 에이전트가 쓰도록 설계한 클라우드 호스팅 브라우저 Kitesurf를 공개했다. 회사는 일반적인 자동화 작업에서 Chromium보다 적은 컴퓨팅 자원을 사용할 수 있다고 설명한다.
더 보기심리적 위기에 놓인 이용자에게 AI 챗봇이 어떤 답을 해야 하는지를 둘러싼 논란이 커지고 있다. 전문가들은 공감형 답변만으로는 부족하며, 위험 평가와 인간 전문가 연결, 안전 데이터 공개가 필요하다고 본다.
더 보기바이트댄스가 최대 10조 파라미터 규모의 AI 모델을 훈련 중인 것으로 알려졌다. 이는 중국 빅테크가 미국 최상위 연구소와의 격차를 좁히는 수준을 넘어 정면 경쟁에 나섰음을 보여준다.
더 보기뉴멕시코주 법원이 소셜미디어 위해와 중독 문제를 다룬 소송에서 Meta에 5억6700만 달러의 추가 벌금을 명령했다. 앞서 3월 부과된 3억7500만 달러를 더하면 이 사건의 벌금 총액은 9억4200만 달러다.
더 보기