아티클 목록으로
비전·비디오

FlowMimic: 이미지 편집 데이터를 영상 편집으로 옮기는 방법

약 2분 소요

소개

영상 편집 모델은 구조보다 데이터에서 먼저 막히는 경우가 많다. 기존 영상 편집 데이터 구축은 마스크 주석, 이미지-투-비디오 기반 합성, ControlNet 유사 가이던스, VLM 기반 품질 필터링 등 여러 단계를 거쳐야 해서 비용과 시간이 많이 든다. 그 결과 영상 편집 태스크의 다양성은 이미지 편집에 비해 좁은 편이다. FlowMimic은 이 문제를 데이터 생성 방식 자체로 풀려는 연구다.

핵심 포인트

  • 이미지 편집에서 영상 편집 샘플 생성: pixel-pair temporal warped flow field를 이용해 이미지 편집 샘플을 실시간으로 대응되는 영상 편집 샘플로 변환한다.
  • 마스크 없는 학습: 사람 손으로 영역을 표시하지 않아도 되어 데이터 제작 부담이 줄어든다.
  • 이미지와 영상을 하나의 체계로 통합: 이미지를 영상의 특수한 경우로 보고, modality mimic generation loss와 modality mimic editing loss로 두 모달의 능력을 서로 맞춘다.
  • 언어 기반 국소 편집 내재화: 지시문을 이해하고, 참조 이미지에서 대상 영역을 찾고, 그 부분만 수정하는 능력을 외부 보조 없이 모델 내부에 학습시키려 한다.

의미와 영향

이 연구의 가치는 영상 편집의 성능 향상만이 아니다. 이미지 편집 데이터를 영상 편집 학습에 재사용할 수 있는 길을 제시했다는 점이 중요하다. 만약 이런 방식이 잘 작동한다면, 데이터 수집 비용을 낮추면서도 더 다양한 편집 상황을 학습시킬 수 있다.

또한 언어 지시 기반 편집에서 중요한 것은 단순한 문장 이해가 아니라, 어디를 바꿔야 하는지 정확히 찾는 능력이다. FlowMimic은 이 지역화 능력을 모델이 스스로 익히도록 설계한다는 점에서 흥미롭다. 이는 앞으로의 편집 모델이 외부 마스크나 추가 도구에 얼마나 의존해야 하는지에 대한 대안적 방향이 될 수 있다.

공개된 요약만 보면 이 논문은 제품 발표가 아니라 방법론 제안에 가깝다. 실험 성능의 세부 평가는 본문을 더 봐야 하지만, 큰 방향은 분명하다. 이미지와 영상 편집의 경계를 낮추고, 영상 편집 데이터를 더 쉽게 만들자는 것이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까
비전·비디오
cctest.ai
비전·비디오

장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까

장시간 동영상 멀티모달 모델에서 프레임 선택, 공간 압축, 절약한 예산의 재투자를 분리해 비교한 연구가 나왔다. 결과적으로 중요한 것은 프레임을 무조건 선명하게 만드는 것이 아니라, 질문과 관련된 시간적 증거를 더 넓게 확보하는 것으로 나타났다.

더 보기
CCTest · Blog
Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개
비전·비디오
cctest.ai
비전·비디오

Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개

Google DeepMind가 Gemini에 Agentic Video Understanding을 도입했습니다. 모델이 영상, 오디오, 자막을 상황에 맞게 검색하고 다시 확인하며, 공식 벤치마크에서 토큰 사용량은 최대 88%, 비용은 최대 66% 줄고 정확도는 최대 7% 향상됐다고 밝혔습니다.

더 보기
CCTest · Blog
Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성
비전·비디오
cctest.ai
비전·비디오

Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성

Luce는 기하 구조와 PBR 재질을 통합한 멀티모달 Gaussian 표현을 제안하고, 단일 이미지에서 재조명 가능한 3D 에셋을 생성합니다. PBR Gaussian과 함께 텍스처 메시 및 탄젠트 공간 노멀 맵도 선택적으로 출력할 수 있습니다.

더 보기