AlayaRenderer-Flash, 생성형 월드 렌더링을 플레이 가능한 30 FPS로 끌어올리다
AlayaRenderer-Flash는 생성형 월드 렌더링 속도를 0.56 FPS에서 31.54 FPS로 높여, 물리 엔진 기반 인터랙티브 장면을 실시간 플레이에 가깝게 만들었다. 텍스트만으로 영상을 상상하는 방식이 아니라, 구조화된 월드 상태를 바탕으로 RGB 프레임을 합성한다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 795개의 아티클
AlayaRenderer-Flash는 생성형 월드 렌더링 속도를 0.56 FPS에서 31.54 FPS로 높여, 물리 엔진 기반 인터랙티브 장면을 실시간 플레이에 가깝게 만들었다. 텍스트만으로 영상을 상상하는 방식이 아니라, 구조화된 월드 상태를 바탕으로 RGB 프레임을 합성한다.
더 보기이 논문은 MoE 학습에서 큰 메모리 비용을 차지하는 옵티마이저 상태에 초점을 맞춘다. SkewAdam은 백본, 전문가, 라우터에 서로 다른 상태 전략을 적용해 보고된 실험에서 메모리를 크게 줄이면서 검증 성능도 유지했다.
더 보기새 논문은 텍스트-이미지 Diffusion Transformer에서 구조적 텍스트 템플릿 토큰이 단순한 자리표시자가 아니라고 주장한다. 이 토큰들은 생성 과정에서 객체 정체성을 유지하는 암묵적 의미 레지스터로 작동한다.
더 보기이 논문은 RLVR이 모델의 특이값 스펙트럼을 크게 다시 쓰기보다, 입력·출력 특이 프레임의 변화를 통해 새 능력을 획득한다고 설명한다. 이를 바탕으로 고정 스펙트럼 최적화 스택인 ISO를 제안한다.
더 보기이 논문은 확산 언어 모델이 명시적인 타임스텝 없이도 내부에서 디노이징 진행 상태를 추적하는지 분석한다. 연구진은 잔차 스트림에서 시간과 관련된 잠재 신호를 디코딩할 수 있음을 보였다.
더 보기AlayaWorld는 텍스트, 이미지, 비디오 입력을 바탕으로 탐색 가능한 가상 환경을 생성하려는 비디오 월드 모델이다. 핵심은 짧은 영상 생성이 아니라 상호작용, 장기 일관성, 효율적인 응답을 함께 달성하는 데 있다.
더 보기ABot-World-0는 비디오 생성을 사용자의 행동에 반응하는 월드 모델로 확장하려는 시도다. 다중 데이터 인프라, 장기 롤아웃 증류, 스트리밍 추론 최적화를 결합해 단일 RTX 5090에서 720P 실시간 생성을 보고했다.
더 보기SciForma는 과학 도식 생성에서 겉보기 품질보다 구조적 충실성을 핵심 문제로 제시한다. 구성요소, 화살표, 텍스트를 별도 축으로 나누고 세 축이 동시에 맞도록 학습한다.
더 보기AutoIndex는 검색기나 리랭커를 바꾸는 대신, 색인 전에 문서를 어떤 형태로 변환할지 학습하는 프레임워크입니다. BM25를 고정한 조건에서도 CRUMB의 8개 검색 과제 모두에서 Recall@100 개선을 보였습니다.
더 보기Mage-Flow는 이미지 생성 모델의 경쟁력이 단순한 파라미터 확대만으로 결정되지 않는다는 점을 보여준다. 4B 규모에서 토크나이저, 확산 Transformer, CUDA 최적화를 함께 설계해 생성과 편집을 모두 겨냥한다.
더 보기이 논문은 LLM의 판정자 역할을 코치 역할로 확장해, 점수 하나가 아니라 재사용 가능한 경험 지식을 학습 신호로 삼는다. 검증이 어려운 개방형 과제에서 더 촘촘한 피드백을 활용하려는 접근이다.
더 보기NexForge는 LLM Agent 후학습에서 병목이 되는 실행 가능한 훈련 데이터 확장 문제를 다룹니다. 고정 도구나 저장소가 아니라 고수준 능력 요구사항에서 출발해 작업과 전문가 궤적을 생성합니다.
더 보기FlowMimic은 영상 편집 데이터 수집이 비싸고 번거롭다는 문제를 정면으로 다룬다. 이미지 편집 샘플을 실시간으로 영상 편집 샘플로 바꾸고, 이미지와 영상의 능력을 서로 모방하게 만들어 하나의 모델로 묶는다.
더 보기다국어 ASR은 언어 수가 많다고 해서 자동으로 고르게 잘 동작하지 않습니다. GigaAM Multilingual은 중앙아시아 저자원 언어를 대상으로 데이터 편향을 줄이는 학습 전략을 제시합니다.
더 보기SeerGuard는 한 번의 잘못된 조작이 되돌릴 수 없는 결과로 이어질 수 있는 모바일 GUI 에이전트를 위해, 명령과 행동을 실행 전에 검사하는 안전 프레임워크다.
더 보기이 논문의 핵심은 더 큰 범용 모델을 만드는 것이 아니라, 에이전트가 스스로 경로를 점검하며 개선할 수 있는 훈련 환경을 설계한 데 있다. 검증 가능한 상호작용이 자기 개선의 기반이 된다.
더 보기GEPO는 GRPO를 가볍게 확장해 prompt 그룹의 엔트로피를 기준으로 advantage를 비대칭적으로 조정한다. 서로 다른 탐색 수준이 필요한 혼합 태스크 학습에서 더 균형 잡힌 최적화를 노린다.
더 보기긴 컨텍스트를 다룰수록 중요한 것은 더 많이 넣는 일이 아니라 무엇을 남길지 정하는 일입니다. SWE-Pruner Pro는 이 판단을 외부 분류기가 아니라 모델 내부 표현으로 처리합니다.
더 보기DiFA는 확산 모델의 추론 중 생성되는 과거 예측을 단순한 적분 보조값이 아니라 상관된 관측으로 활용하는 재학습 불필요 프레임워크입니다. 전방 확산 과정과 정렬된 시간적 합의를 통해 안정성과 세부 묘사를 높이는 것이 목표입니다.
더 보기RynnBrain 1.1은 지각, 공간 추론, 위치 추정, 계획을 하나의 embodied framework로 묶은 모델군이다. 단순한 인식 성능보다 실제 로봇 조작에 바로 쓰일 수 있는 표현을 강화한 점이 핵심이다.
더 보기API를 호출하는 에이전트는 많은 고품질 궤적이 필요하지만, 실제 환경을 모두 구축하는 일은 느리고 비쌉니다. 이 논문은 API 명세만으로 LLM이 상태를 가진 환경을 시뮬레이션하도록 합니다.
더 보기