마스크드 확산 언어모델, Agent RL을 위한 텍스트 월드 모델로 부상
이 논문은 Masked Diffusion Language Models가 텍스트 기반 월드 모델에서 자기회귀 모델의 좌에서 우로 생성 편향을 줄일 수 있다고 주장한다. 양방향 denoising을 통해 도구 스키마, 이전 턴, 도메인 규칙, 기대 결과 같은 전역 앵커와 더 잘 맞춘다는 설명이다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 795개의 아티클
이 논문은 Masked Diffusion Language Models가 텍스트 기반 월드 모델에서 자기회귀 모델의 좌에서 우로 생성 편향을 줄일 수 있다고 주장한다. 양방향 denoising을 통해 도구 스키마, 이전 턴, 도메인 규칙, 기대 결과 같은 전역 앵커와 더 잘 맞춘다는 설명이다.
더 보기Open-AoE는 1인칭 영상 데이터를 모으는 데서 끝나지 않고, 구조화와 학습 활용까지 연결하는 공개 인프라를 제안한다.
더 보기Distilled Reinforcement Learning은 결과 보상에 의존하는 강화학습과 교사 분포를 무조건 모방하는 온라인 증류 사이의 간극을 겨냥한다. 교사 모델의 선호를 토큰 수준의 정책 그래디언트에 선택적으로 반영한다.
더 보기이 연구는 긴 녹음에서 무엇을 말했는지뿐 아니라 언제 발생했는지도 답하는 음성 LLM을 제안한다. 최대 120분 입력에 대해 명시적인 타임스탬프가 포함된 응답을 생성할 수 있다. 핵심은 주기적 시간 마커를 연속 음성 토큰과 교차 배치하고, 대규모 합성 감독으로 학습하는 방식이다.
더 보기HarmoHOI는 다중 시점 HOI 합성에서 가장 어려운 두 문제, 즉 화면 일관성과 3D 운동 정합을 동시에 다룬다. RGB 비디오와 3D 포인트 트랙을 하나의 확산 프레임워크로 공동 생성하는 방식이 핵심이다.
더 보기이 논문은 오프폴리시 응답을 그대로 모방하지 않고, 각 토큰이 올바른지 판단하도록 학습하는 TOPL을 제안한다. 요약과 번역에서 분포 변화에 더 강한 성능을 보였다.
더 보기TimeLens2는 영상 시간적 그라운딩을 가변 개수의 구간 집합 예측 문제로 다루며, 모델이 무엇이 일어났는지뿐 아니라 그 근거가 언제 나타났는지도 제시하도록 한다. 2B, 4B, 8B 모델은 각각 Qwen3-VL 백본 대비 뚜렷한 성능 향상을 보였다.
더 보기3D-Fit은 구조 기반 신약 설계에서 범용 LLM이 3차원 공간 제약을 만족하는 리간드를 생성할 수 있는지 평가하는 벤치마크다. 연구 결과는 가능성을 보여주지만, 전용 확산 모델과의 격차도 분명히 드러낸다.
더 보기EvolvingWorld는 단순한 대사 생성이 아니라, 이야기가 진행될수록 인물과 세계 상태가 함께 갱신되는 구조를 제안한다. 정적인 페르소나 모방을 넘어 장기 일관성을 다루려는 시도다.
더 보기ReflectWorld-MM은 연속되는 영상 속에서 누가 다시 나타났는지, 무엇이 변했는지를 엔티티 단위로 기억하려는 시스템이다. 단순 저장이 아니라, 세계 경험을 구조화해 축적하는 방향으로 비디오 메모리를 재설계했다.
더 보기HOMIE는 인물의 정체성을 유지하면서 사물과의 상호작용까지 더 정확하게 생성하려는 영상 개인화 프레임워크다. 멀티모달 대형 모델의 정보를 생성 과정에 더 잘 연결한다.
더 보기Apple-PI는 영상이 그럴듯한지만 보지 않고, 물리 법칙을 따라 생성됐는지도 묻는 벤치마크입니다. 결과뿐 아니라 그에 이르는 추론 과정까지 함께 평가합니다.
더 보기DiffGI는 의류처럼 얇은 쉘 구조와 비다양체 표면을 기존 체적 표현이 잘 다루지 못한다는 문제에서 출발합니다. 연속 2D TSDF와 미분 가능한 Marching Squares를 결합해 2D 잠재공간과 3D 표면 최적화를 직접 연결합니다.
더 보기JoyNexus는 VLA 모델의 지도 미세조정, 강화학습, 평가를 공유 인프라 기반의 멀티테넌트 서비스로 구성해 GPU 활용률과 운영 효율을 높이려는 접근이다.
더 보기207개 GitHub 프로젝트의 리뷰 완료 Pull Request 102만 건을 분석한 연구에 따르면, AI Agent 참여는 코드 리뷰 결정을 빠르게 만들지만 품질 향상으로 일관되게 이어지지는 않는다.
더 보기이 논문은 RLVR에서 흔히 쓰이는 엔트로피 기반 advantage shaping이 유용한 불확실성과 해로운 혼란을 구분하지 못한다는 점을 지적한다. Contrastive Policy Optimization은 참조 유도 생성과 일반 생성의 token 단위 분포 차이를 활용해 더 정확성에 가까운 학습 신호를 만든다.
더 보기SVR-R1은 추론 단계의 자기 점검을 강화학습 훈련 루프 안으로 끌어들인 프레임워크다. 모델은 답을 낸 뒤 스스로 Yes/No 판단을 하고, No라면 다시 생각한다.
더 보기RecGPT-V3는 지속적으로 진화하는 사용자 메모리, Semantic IDs 기반 상품 grounding, 잠재 토큰 추론을 결합한 산업용 LLM 추천 시스템이다. 타오바오 ‘Guess What You Like’ 피드 적용 결과 GMV +3.97%, 서빙 리소스 소비 52.4% 감소가 보고됐다.
더 보기이 연구는 플라즈마 진단 모델을 깨끗한 센서 데이터가 아니라 실제에 가까운 고장 조건에서 평가한다. 특히 플라즈마 붕괴에 가까운 시점의 센서 손상이 시계열 모델 성능을 크게 무너뜨릴 수 있음을 보였다.
더 보기Agon은 비슷한 실력과 다른 행동 특성을 가진 두 모델을 같은 문제에서 경쟁시켜, 서로를 추론 품질의 암묵적 평가자로 활용하는 강화학습 방식이다.
더 보기RESOURCE2SKILL은 튜토리얼 영상, 코드 저장소, 문서와 참고 결과물을 소프트웨어 에이전트가 재사용할 수 있는 실행형 스킬로 변환하는 프레임워크다.
더 보기