아티클 목록으로
멀티모달

Multimodal Flow, 언어와 비전을 하나의 연속 생성 과정으로 통합

약 3분 소요

개요

통합 멀티모달 모델은 대체로 두 가지 방식으로 설계된다. 하나는 언어와 이미지를 모두 이산 토큰으로 바꾸는 방식이고, 다른 하나는 언어에는 이산 예측을, 이미지에는 연속 생성을 적용하는 방식이다. 전자는 이미지 양자화 과정에서 정보 병목이 생길 수 있고, 후자는 모달리티별 학습 목표와 샘플링 절차를 따로 설계해야 한다. HUST Vision Lab의 Multimodal Flow는 언어와 비전을 하나의 연속 생성 과정에서 다루는 대안을 제시한다.

핵심 설계

  • 연속 하이퍼청크: 이미지를 이산 시각 어휘로 변환하지 않고 멀티모달 연속 표현을 사용한다. 텍스트 블록과 이미지를 순서가 있는 ‘연속 하이퍼청크’로 배치해 텍스트 토큰의 순서와 이미지의 공간 구조를 보존한다.
  • 공유 Flow Matching 백본: chunk-causal 백본은 하이퍼청크 전체에 걸친 하나의 벡터장을 Flow Matching으로 학습한다. 언어와 이미지가 서로 다른 생성 메커니즘이 아니라 공통의 연속 프로세스를 따르도록 하는 접근이다.
  • 공유 상호작용과 전용 처리: 공동 어텐션은 텍스트와 이미지가 서로 정보를 주고받게 한다. 동시에 모달리티별 피드포워드 네트워크가 각 데이터 유형의 고유한 특징을 처리한다.
  • 학습과 추론의 차이: 학습 중에는 여러 목표 청크를 병렬로 예측하고, 추론 중에는 하이퍼청크를 순차적으로 생성한다. 연속 표현을 사용하면서도 인과적 생성 순서를 유지하는 구조다.

보고된 실험

연구진은 MF-1을 구현하고 0.6B, 1.2B, 1.6B 규모에서 멀티모달 사전학습을 수행했다. 제공된 요약에 따르면 지속적인 사전학습은 세 규모 모두에서 멀티모달 모델링 능력을 꾸준히 향상시켰다. 150B 사전학습 토큰을 사용한 설정에서 MF-1은 GenEval과 DPG-Bench 평균 82.8, VQAv2·MMBench·POPE 평균 75.3을 기록했다. 또한 데이터, 최적화 방식, 파라미터 예산을 맞춘 비교에서 대표적인 이산형 및 하이브리드 모델보다 높은 성능을 보였다고 보고됐다.

의미와 남은 과제

이 연구의 핵심은 새로운 이미지 생성 기법을 제안하는 데만 있지 않다. 이미지를 언어와 같은 이산 토큰으로 바꿔야 통합 모델을 만들 수 있다는 가정에 도전한다는 점이 중요하다. 텍스트와 이미지를 구조화된 연속 블록으로 다루면 언어 이해, 이미지 생성, 크로스모달 상호작용을 더 공통된 기반에서 연구할 가능성이 열린다.

다만 현재 공개된 자료만으로는 장문 생성, 복잡한 구성의 이미지, 추론 속도, 학습 비용, 데이터 비율 변화에 따른 성능을 충분히 판단하기 어렵다. 더 큰 규모에서도 연속 플로우 방식의 장점이 유지되는지는 후속 비교 실험이 필요하다.

코드와 모델이 공개된 만큼, 연구자들은 이 접근을 재현하고 기존 이산형·하이브리드 방식과 직접 비교할 수 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물