JoyAI-Echo-1.5, 지속형 스토리와 인터랙티브 월드를 위한 장기 오디오·비주얼 생성
JoyAI-Echo-1.5는 장편 영상에서 인물의 외모와 목소리를 유지하고, 사용자 조작에 반응하는 인터랙티브 월드 생성을 목표로 하는 통합 오디오·비주얼 시스템입니다.
더 보기JoyAI-Echo-1.5는 장편 영상에서 인물의 외모와 목소리를 유지하고, 사용자 조작에 반응하는 인터랙티브 월드 생성을 목표로 하는 통합 오디오·비주얼 시스템입니다.
더 보기새로운 서베이는 스마트 안경을 단순한 카메라나 디스플레이가 아니라 1인칭 지능 플랫폼으로 재정의한다. 핵심은 인식부터 행동까지의 고리를 실제 제약 속에서도 신뢰성 있고 교정 가능하게 유지하는 데 있다.
더 보기LAION-BVD는 웹에서 수집한 동영상 URL을 바탕으로 약 8천만 개의 영상과 총 1천만 시간 분량을 제공하는 공개 데이터셋입니다. 장면 분할, 합성 캡션, 장면 전환 프레임 추출을 통해 영상·음성·이미지 사전학습을 지원합니다.
더 보기DeepSeek가 API 플랫폼에 deepseek-v4-flash-vision-exp를 출시하며 V4 시리즈에 공식 이미지 입력 기능을 추가했다. 도구 사용과 코딩 에이전트 관련 평가에서도 여러 지표가 개선됐다.
더 보기DeepSeek가 V4-Flash에 시각 기능을 더한 실험 버전 DeepSeek-V4-Flash-Vision-Exp를 공개했습니다. 지정된 모델 ID로 API에서 이용할 수 있으며, 기존 텍스트 능력을 유지하면서 이미지 이해를 강화하는 것이 핵심입니다.
더 보기공개 베타 시작 일주일 만에 DeepSeek Harness가 v0.1.0-rc.8을 공개했다. 네이티브 이미지 요청과 텍스트·이미지 혼합 입력을 지원하며, 서브 에이전트 연동과 Windows용 영구 PowerShell 세션도 강화했다.
더 보기MOSS-VL은 비전언어 모델의 핵심 능력으로 ‘말하는 동안에도 보기’를 내세운 오픈 모델군입니다. 게이트형 크로스 어텐션과 상호작용 중심 학습을 통해 새 프레임을 받으면서 발화, 침묵, 답변 수정을 결정하도록 설계됐습니다.
더 보기SPARGen은 공간 지능에 필요한 여러 과제를 지시 조건부 생성 문제로 다시 정의한다. 핵심은 3D 재구성, 조밀 대응, 공간 추론을 별도 모듈이 아니라 하나의 네이티브 멀티모달 생성 프레임워크에서 다루는 것이다.
더 보기UniSwap은 말하는 영상에서 인물의 외형과 음색을 동시에 바꾸기 위한 통합 오디오-비주얼 프레임워크다. 별도 모델을 조합하는 대신 하나의 확산 Transformer 안에서 두 모달리티를 함께 다룬다.
더 보기Ex-Omni-2D는 말은 할 수 있지만 ‘보이지는 않는’ 기존 멀티모달 대화 모델의 한계를 겨냥한다. 텍스트, 개인화 음성, 참조 조건 비디오를 하나의 응답으로 함께 생성한다.
더 보기Evidence-RL은 비전-언어 모델이 정답을 맞혔더라도 실제로 이미지의 핵심 증거를 사용했는지 검증하려는 연구다. CED는 증거 영역을 반사실적으로 중화해 답변이 해당 시각 증거에 의존하는지를 훈련 중 감사한다.
더 보기이미지 생성 대화에서 유용한 후속 편집 제안은 채팅 텍스트만으로 만들 수 없다. 이 연구는 실제 서비스 데이터와 클릭 피드백, 시각 검증기를 결합해 현재 이미지에 맞는 다음 편집 추천을 개선한다.
더 보기Kandinsky Lab이 잠재 확산 모델을 위한 KVAE 토크나이저 패밀리를 공개했다. 이 프로젝트는 오디오, 이미지, 비디오를 텍스트 조건 생성에 적합한 잠재 표현으로 압축하는 데 초점을 맞춘다.
더 보기이 논문은 단일 모델 제안보다, 통합 멀티모달 사전학습이 실제로 어떻게 작동하는지를 체계적으로 설명한다. 지식 흐름, 모달리티 간 시너지와 경쟁, 조기 통합, 효율적 학습 레시피가 핵심이다.
더 보기이 연구는 3D를 별도 작업들의 묶음이 아니라 하나의 통합 멀티모달 문제로 본다. 핵심은 모델 구조뿐 아니라 대규모 3D 학습 데이터를 어떻게 만들었는가에 있다.
더 보기VAD는 멀티모달 on-policy 증류에서 교사 모델의 보정이 실제로 이미지 증거에 근거한 것인지 추정하는 방법이다. 전체 교사 신호를 그대로 따르기보다, 시각적으로 귀속 가능한 성분으로 학생 모델의 학습 목표를 재구성한다.
더 보기이 논문은 여러 참조 이미지를 동시에 사용하는 편집에서 시각적 일관성과 조화를 높이기 위해 Evaluation-Verification Reward, 즉 EVR을 제안한다.
더 보기Mage-VL은 영상 압축 과정에 이미 존재하는 모션 벡터와 잔차 정보를 활용해 시각 토큰 낭비를 줄이는 스트리밍 멀티모달 모델입니다. 모든 프레임을 균일하게 처리하는 대신, 변화가 크고 정보량이 높은 영역에 계산을 집중합니다.
더 보기ClinFusion은 의료용 MLLM의 핵심을 유창한 답변이 아니라 정확한 시각 이해로 본다. 2D와 네이티브 3D 의료 영상을 함께 다루고, 방사선과 실제 업무에 가까운 평가를 제안한다.
더 보기VisCo는 사전학습된 비전-언어 모델의 내부 인코딩 능력을 활용해 시각 토큰을 압축하는 프레임워크입니다. 별도 압축기를 붙이는 대신, 소수의 memory tokens에 시각 정보를 담습니다.
더 보기Tencent Hunyuan 연구진은 고정된 연산 예산에서 네이티브 멀티모달 사전학습을 어떻게 확장해야 하는지 분석했다. 핵심은 언어 목표와 멀티모달 목표가 서로 다른 스케일링 특성을 보인다는 점이다.
더 보기