Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성
Luce는 기하 구조와 PBR 재질을 통합한 멀티모달 Gaussian 표현을 제안하고, 단일 이미지에서 재조명 가능한 3D 에셋을 생성합니다. PBR Gaussian과 함께 텍스처 메시 및 탄젠트 공간 노멀 맵도 선택적으로 출력할 수 있습니다.
더 보기Luce는 기하 구조와 PBR 재질을 통합한 멀티모달 Gaussian 표현을 제안하고, 단일 이미지에서 재조명 가능한 3D 에셋을 생성합니다. PBR Gaussian과 함께 텍스처 메시 및 탄젠트 공간 노멀 맵도 선택적으로 출력할 수 있습니다.
더 보기고덕이 최근 12개 프레임만을 국소 문맥으로 활용해 긴 영상의 3D 장면을 순차적으로 재구성하는 모델 ABot-Recon을 공개했다. 장기 메모리 의존을 없애 장거리 시퀀스에서 발생하는 오차 누적, 속도 저하, 메모리 증가 문제를 줄이는 것이 핵심이다.
더 보기Google DeepMind가 Gemini Omni 1.1 Flash를 공개했다. 장면 연장, 시작·끝 프레임 지정, 360p 미리보기, 최대 4K 출력 등을 통해 생성형 동영상 제작의 반복 작업을 개선한다.
더 보기SparsePR은 재학습 없이 영상 생성 및 월드 모델의 어텐션 연산을 줄이는 희소 어텐션 기법입니다. 응답 결합 파티셔닝과 프로브 기반 잔차 재구성을 결합해 계산량을 낮추면서 출력 품질을 유지합니다.
더 보기InfinityEdit는 완성된 영상 클립을 프레임 단위로 다시 쓰는 대신, 편집 지시를 반영하면서 앞으로 이어질 영상 구간을 생성하는 방식을 제안합니다. 영상 이력, 시간적 인과성, 편집 텍스트를 연결하는 경량 어댑터로 스트리밍 영상 생성기에 편집 기능을 더합니다.
더 보기4DAnyone은 보정되지 않은 단안 인물 영상에서 시점 간 일관성이 높은 다중 시점 영상을 생성한 뒤 이를 4D Gaussian Splatting으로 변환합니다. 늘어나는 참조 정보와 분할된 시점 그룹 사이의 구조적 불일치를 두 가지 컨텍스트 설계로 해결하려 합니다.
더 보기알리바바의 영상 생성 모델 Wan 3.0이 공개 베타에 들어갔다. 가장 눈에 띄는 변화는 doc, ppt, pdf 같은 문서 파일을 직접 입력할 수 있다는 점으로, 영상 생성이 표현 도구에서 업무 도구로 확장되고 있다는 신호다.
더 보기미래 프레임 없이, 길이도 미리 정하지 않은 상태에서 비디오를 편집하는 것은 쉽지 않습니다. JoyAI-Video-Edit는 자기회귀 확산과 증류 전략을 결합해 실시간성과 원본 보존을 함께 노립니다.
더 보기InfiniSplat은 한 장의 이미지에서 큰 시점 변화에도 더 일관된 3D Gaussian Splatting 표현을 생성하려는 프레임워크입니다. 픽셀 격자 중심 예측 대신 기하 기반 샘플링과 암시적 가우시안 디코딩을 사용합니다.
더 보기Motion Beyond Morphology(MBM)는 참조 영상과 대상 객체의 형태가 크게 달라도 의미 있는 움직임을 옮기기 위한 프레임워크다. 고정된 구조 대응 대신, 범주를 넘어 보존될 수 있는 추상적 모션 표현을 활용한다.
더 보기새 논문은 극심한 노이즈가 섞인 RGB 관측과 근적외선(NIR) 단서를 3D 공간에서 융합하는 3DarkFusion을 제안한다. 깨끗한 RGB 감독 데이터 없이 저조도 컬러 이미지를 복원하는 것이 핵심이다.
더 보기Meshy T2는 메시를 토큰 시퀀스로 순차 생성하는 방식의 한계를 피하고, Flow Matching과 정점 단위 연속 잠재 표현으로 폴리곤 메시를 직접 생성하려는 프레임워크입니다.
더 보기AI 영상 생성 스타트업 Pippa는 아티스트 스타일이 사용될 때 수익을 나누는 방식으로 ‘더 윤리적인 AI’를 내세운다. 하지만 기반 모델이 여전히 광범위하게 수집된 온라인 콘텐츠에 의존한다는 점은 남아 있다.
더 보기VideoCoCo는 텍스트 프롬프트를 실행 가능한 Blender 프로그램으로 바꾼 뒤, 시뮬레이션 초안을 사실적인 영상으로 편집하는 이중 엔진 프레임워크다. 핵심 목표는 텍스트-비디오 생성에서 부족했던 물리적 일관성을 높이는 것이다.
더 보기O-VAD는 산업 공정 영상에서 객체를 분할·추적하고 시간에 따른 상태 궤적을 추론해 이상을 찾는 학습 불필요 프레임워크다. 핵심 주장은 프런티어 VLM의 산업 현장 성능 저하가 추론 능력 부족보다 객체 수준 증거 부족에서 비롯된다는 것이다.
더 보기Netflix 관련 연구 ID-V2V는 편집된 키프레임의 장면, 조명, 스타일 변화를 전체 영상으로 확산시키면서 얼굴 유사도, 표정, 시선, 립싱크를 보존하는 것을 목표로 한다.
더 보기이 논문은 3D 엔진 조건 기반 장기 비디오 생성에서 카메라가 같은 장소를 다시 방문할 때 외관이 달라지는 문제를 다룬다. 과거 잠재 청크를 KV cache로 되돌리고, 자세와 깊이 재투영으로 attention을 유도해 추가 학습 없이 일관성을 높인다.
더 보기SANA-Video 2.0은 선형 어텐션의 효율성과 softmax 어텐션의 표현력을 결합한 비디오 확산 Transformer입니다. 논문은 단일 H100에서 최대 720p 비디오 생성을 목표로 하며, 긴 비디오에서 계산 효율의 이점이 커진다고 설명합니다.
더 보기Self Gradient Forcing은 자기회귀 영상 확산 모델에서 미래 프레임의 손실이 과거 생성 잠재표현의 KV 메모리 쓰기를 충분히 감독하지 못하는 문제를 다룹니다. 두 단계 학습으로 긴 rollout 전체를 역전파하지 않고도 빠진 기울기 신호를 복원합니다.
더 보기FlowMimic은 영상 편집 데이터 수집이 비싸고 번거롭다는 문제를 정면으로 다룬다. 이미지 편집 샘플을 실시간으로 영상 편집 샘플로 바꾸고, 이미지와 영상의 능력을 서로 모방하게 만들어 하나의 모델로 묶는다.
더 보기HOMIE는 인물의 정체성을 유지하면서 사물과의 상호작용까지 더 정확하게 생성하려는 영상 개인화 프레임워크다. 멀티모달 대형 모델의 정보를 생성 과정에 더 잘 연결한다.
더 보기