ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해
ShallowStream은 MLLM의 얕은 층을 활용해 스트리밍 영상의 프레임 인코딩과 검색 색인 구축을 수행하고, 질의가 들어올 때만 깊은 층을 사용합니다. 논문은 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 줄였다고 보고합니다.
더 보기ShallowStream은 MLLM의 얕은 층을 활용해 스트리밍 영상의 프레임 인코딩과 검색 색인 구축을 수행하고, 질의가 들어올 때만 깊은 층을 사용합니다. 논문은 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 줄였다고 보고합니다.
더 보기arXiv 연구가 동영상 생성 모델의 증류와 인간 선호 정렬을 단일 단계에서 결합하는 DM-Align을 제안했다. 샘플 분포 차이로 선호 유도 그래디언트를 구성해 기존 강화학습 파이프라인의 계산량과 불안정성을 줄이는 것이 목표다.
더 보기장시간 동영상 멀티모달 모델에서 프레임 선택, 공간 압축, 절약한 예산의 재투자를 분리해 비교한 연구가 나왔다. 결과적으로 중요한 것은 프레임을 무조건 선명하게 만드는 것이 아니라, 질문과 관련된 시간적 증거를 더 넓게 확보하는 것으로 나타났다.
더 보기Google DeepMind가 Gemini에 Agentic Video Understanding을 도입했습니다. 모델이 영상, 오디오, 자막을 상황에 맞게 검색하고 다시 확인하며, 공식 벤치마크에서 토큰 사용량은 최대 88%, 비용은 최대 66% 줄고 정확도는 최대 7% 향상됐다고 밝혔습니다.
더 보기Luce는 기하 구조와 PBR 재질을 통합한 멀티모달 Gaussian 표현을 제안하고, 단일 이미지에서 재조명 가능한 3D 에셋을 생성합니다. PBR Gaussian과 함께 텍스처 메시 및 탄젠트 공간 노멀 맵도 선택적으로 출력할 수 있습니다.
더 보기고덕이 최근 12개 프레임만을 국소 문맥으로 활용해 긴 영상의 3D 장면을 순차적으로 재구성하는 모델 ABot-Recon을 공개했다. 장기 메모리 의존을 없애 장거리 시퀀스에서 발생하는 오차 누적, 속도 저하, 메모리 증가 문제를 줄이는 것이 핵심이다.
더 보기Google DeepMind가 Gemini Omni 1.1 Flash를 공개했다. 장면 연장, 시작·끝 프레임 지정, 360p 미리보기, 최대 4K 출력 등을 통해 생성형 동영상 제작의 반복 작업을 개선한다.
더 보기SparsePR은 재학습 없이 영상 생성 및 월드 모델의 어텐션 연산을 줄이는 희소 어텐션 기법입니다. 응답 결합 파티셔닝과 프로브 기반 잔차 재구성을 결합해 계산량을 낮추면서 출력 품질을 유지합니다.
더 보기InfinityEdit는 완성된 영상 클립을 프레임 단위로 다시 쓰는 대신, 편집 지시를 반영하면서 앞으로 이어질 영상 구간을 생성하는 방식을 제안합니다. 영상 이력, 시간적 인과성, 편집 텍스트를 연결하는 경량 어댑터로 스트리밍 영상 생성기에 편집 기능을 더합니다.
더 보기4DAnyone은 보정되지 않은 단안 인물 영상에서 시점 간 일관성이 높은 다중 시점 영상을 생성한 뒤 이를 4D Gaussian Splatting으로 변환합니다. 늘어나는 참조 정보와 분할된 시점 그룹 사이의 구조적 불일치를 두 가지 컨텍스트 설계로 해결하려 합니다.
더 보기알리바바의 영상 생성 모델 Wan 3.0이 공개 베타에 들어갔다. 가장 눈에 띄는 변화는 doc, ppt, pdf 같은 문서 파일을 직접 입력할 수 있다는 점으로, 영상 생성이 표현 도구에서 업무 도구로 확장되고 있다는 신호다.
더 보기미래 프레임 없이, 길이도 미리 정하지 않은 상태에서 비디오를 편집하는 것은 쉽지 않습니다. JoyAI-Video-Edit는 자기회귀 확산과 증류 전략을 결합해 실시간성과 원본 보존을 함께 노립니다.
더 보기InfiniSplat은 한 장의 이미지에서 큰 시점 변화에도 더 일관된 3D Gaussian Splatting 표현을 생성하려는 프레임워크입니다. 픽셀 격자 중심 예측 대신 기하 기반 샘플링과 암시적 가우시안 디코딩을 사용합니다.
더 보기Motion Beyond Morphology(MBM)는 참조 영상과 대상 객체의 형태가 크게 달라도 의미 있는 움직임을 옮기기 위한 프레임워크다. 고정된 구조 대응 대신, 범주를 넘어 보존될 수 있는 추상적 모션 표현을 활용한다.
더 보기새 논문은 극심한 노이즈가 섞인 RGB 관측과 근적외선(NIR) 단서를 3D 공간에서 융합하는 3DarkFusion을 제안한다. 깨끗한 RGB 감독 데이터 없이 저조도 컬러 이미지를 복원하는 것이 핵심이다.
더 보기Meshy T2는 메시를 토큰 시퀀스로 순차 생성하는 방식의 한계를 피하고, Flow Matching과 정점 단위 연속 잠재 표현으로 폴리곤 메시를 직접 생성하려는 프레임워크입니다.
더 보기AI 영상 생성 스타트업 Pippa는 아티스트 스타일이 사용될 때 수익을 나누는 방식으로 ‘더 윤리적인 AI’를 내세운다. 하지만 기반 모델이 여전히 광범위하게 수집된 온라인 콘텐츠에 의존한다는 점은 남아 있다.
더 보기VideoCoCo는 텍스트 프롬프트를 실행 가능한 Blender 프로그램으로 바꾼 뒤, 시뮬레이션 초안을 사실적인 영상으로 편집하는 이중 엔진 프레임워크다. 핵심 목표는 텍스트-비디오 생성에서 부족했던 물리적 일관성을 높이는 것이다.
더 보기O-VAD는 산업 공정 영상에서 객체를 분할·추적하고 시간에 따른 상태 궤적을 추론해 이상을 찾는 학습 불필요 프레임워크다. 핵심 주장은 프런티어 VLM의 산업 현장 성능 저하가 추론 능력 부족보다 객체 수준 증거 부족에서 비롯된다는 것이다.
더 보기Netflix 관련 연구 ID-V2V는 편집된 키프레임의 장면, 조명, 스타일 변화를 전체 영상으로 확산시키면서 얼굴 유사도, 표정, 시선, 립싱크를 보존하는 것을 목표로 한다.
더 보기이 논문은 3D 엔진 조건 기반 장기 비디오 생성에서 카메라가 같은 장소를 다시 방문할 때 외관이 달라지는 문제를 다룬다. 과거 잠재 청크를 KV cache로 되돌리고, 자세와 깊이 재투영으로 attention을 유도해 추가 학습 없이 일관성을 높인다.
더 보기