아티클 목록으로
비전·비디오

HOMIE, 사람-사물 중심 영상 개인화의 새 접근

약 2분 소요

소개

주체 기반 영상 생성에서 중요한 것은 단순히 특정 인물을 닮게 만드는 것만이 아닙니다. 그 인물이 어떤 사물과 어떻게 상호작용하는지까지 자연스럽게 표현해야 실제 영상처럼 보입니다. 특히 로고나 추상적 개념처럼 의미가 중요한 대상에서는 이 문제가 더 어려워집니다. HOMIE는 이런 사람-사물 중심 영상 개인화(HOCVP)를 다루는 프레임워크입니다.

핵심 포인트

  • 두 가지 입력 상황을 하나로 통합: 서로 다른 주체를 개인화하는 경우와, 동일 주체의 OCR 맵·다중 시점 같은 참조를 활용하는 경우를 함께 다룬다.
  • 더 나은 MLLM 통합: 참조 수준의 관계 지식을 추출하면서도 텍스트 인코더의 제어성을 해치지 않도록 설계했다.
  • Global multimodal guidance: self-attention 안에 멀티모달 가이던스를 넣어 MLLM에서 온 의미 특징과 VAE 토큰을 정렬한다.
  • Modality-reference embedding: 서로 다른 출처의 토큰을 구분하고, 동일 주체의 참조 이미지 토큰을 연결한다.

의미와 영향

이 연구는 영상 개인화에서 ‘정체성 보존’과 ‘상호작용 이해’가 별개의 문제임을 보여준다. 외형만 비슷해도 손동작이나 물체와의 관계가 어색하면 결과물의 설득력은 떨어진다. HOMIE의 접근은 생성 모델 내부에서 관계 정보를 더 직접적으로 다루려는 시도라는 점에서 의미가 있다.

초록에 따르면 이 방법은 여러 HOCVP 작업에서 state-of-the-art 성능을 달성했다. 실제 응용에서는 참조 입력의 품질과 복잡한 장면에서의 일반화가 앞으로의 관건이 될 것이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
TimeLens2: 영상 MLLM이 근거가 나온 시간을 찾게 하다
비전·비디오
cctest.ai
비전·비디오

TimeLens2: 영상 MLLM이 근거가 나온 시간을 찾게 하다

TimeLens2는 영상 시간적 그라운딩을 가변 개수의 구간 집합 예측 문제로 다루며, 모델이 무엇이 일어났는지뿐 아니라 그 근거가 언제 나타났는지도 제시하도록 한다. 2B, 4B, 8B 모델은 각각 Qwen3-VL 백본 대비 뚜렷한 성능 향상을 보였다.

더 보기
CCTest · Blog
FlowMimic: 이미지 편집 데이터를 영상 편집으로 옮기는 방법
비전·비디오
cctest.ai
비전·비디오

FlowMimic: 이미지 편집 데이터를 영상 편집으로 옮기는 방법

FlowMimic은 영상 편집 데이터 수집이 비싸고 번거롭다는 문제를 정면으로 다룬다. 이미지 편집 샘플을 실시간으로 영상 편집 샘플로 바꾸고, 이미지와 영상의 능력을 서로 모방하게 만들어 하나의 모델로 묶는다.

더 보기
CCTest · Blog
REBASE: 배경 특징을 지워 학습 없는 인컨텍스트 분할을 개선하다
비전·비디오
cctest.ai
비전·비디오

REBASE: 배경 특징을 지워 학습 없는 인컨텍스트 분할을 개선하다

REBASE는 한 장의 주석된 참조 이미지로 새로운 대상을 분할하는 training-free 프레임워크입니다. 참조 이미지의 배경 특징 부분공간을 제거해, 배경 때문에 생기는 잘못된 이미지 간 유사도 매칭을 줄입니다.

더 보기