아티클 목록으로
비전·비디오

OneStreamer: 영상을 보며 기억하고 적절한 순간에 응답하는 4B 모델

약 3분 소요

배경

스트리밍 영상과 대화하는 모델은 일반적인 영상 질의응답보다 복잡한 문제를 다룹니다. 미래의 질문이 무엇인지 알기 전에 어떤 장면이 중요한지 기록해야 하기 때문입니다. 그러나 모든 과거 시각 특징을 계속 보관하면 계산량과 지연이 커집니다. 모델은 증거가 충분해지는 순간을 판단해 응답해야 하며, 새로운 프레임을 무작정 기다려서도 안 됩니다.

OneStreamer는 지각, 기억, 응답 타이밍을 별도의 단계로 나누기보다 능동적 생성을 통해 함께 학습합니다. 영상이 들어오는 동안 관찰 내용을 기록하고, 관련 증거가 갖춰지면 과제에 답하는 방식입니다.

핵심 구성

  • PHCM 기반 계층형 캡션 메모리: Proactive Hierarchical Caption Memory는 관찰된 장면의 국소적 세부 정보를 시간 정보와 함께 설명하고, 이벤트가 끝나면 요약을 생성합니다. 원본 프레임이 최근 시각 창에서 벗어나도 해당 사실을 텍스트 기록으로 다시 활용할 수 있습니다.
  • 최근 영상과 생성 메모리의 결합: 추론 과정에서 모델은 새로 들어온 영상과 과거에 생성한 캡션을 함께 사용합니다. 모든 과거 시각 특징을 반복해서 불러오지 않아도 장기적인 영상 맥락에 접근할 수 있다는 점이 특징입니다.
  • PSTL을 통한 응답 시점 학습: 스트리밍 데이터에는 반복되는 대기 상태가 많습니다. Proactive State Transition Learning은 출력 앵커 전반의 감독 정보를 유지하면서 상태 변화와 상태 지속을 대표하는 토큰을 선택해, 대기 상태가 학습을 지배하는 문제를 줄입니다.
  • 스트리밍 데이터 합성: 각 시점에 실제로 이용 가능한 증거에 맞춰 캡션과 답변의 내용 및 타이밍을 정렬하는 파이프라인을 구축했습니다. 합성된 캡션·질의응답과 정제된 오픈소스 데이터를 결합해 OneStreamer-1M을 만들었습니다.

결과와 의미

제공된 자료에 따르면 OneStreamer의 4B 모델은 지각, 기억, 능동적 응답을 포함하는 8개 스트리밍 영상 이해 벤치마크 모두에서 비교 대상 중 가장 높은 종합 결과를 기록했습니다. 제거 실험에서는 생성된 캡션을 유지할 때 과거 영상에 대한 질의응답이 개선되면서 실시간 지각 성능은 떨어지지 않았습니다. 또한 PSTL은 주석이 있는 상태 토큰의 27.5%만 감독에 사용하면서도 밀집 상태 감독보다 좋은 결과를 보였습니다.

이 연구의 핵심적인 시사점은 스트리밍 영상의 기억을 계속 늘어나는 시각 특징의 저장소가 아니라, 시간과 연결된 재사용 가능한 기록으로 바라본다는 데 있습니다. 장시간 영상 분석이나 카메라 비서처럼 낮은 지연과 과거 사건 참조가 동시에 필요한 응용에 적용할 수 있는 방향입니다.

다만 생성된 기록이 잘못되면 그 오류가 이후 응답의 근거로 반복 사용될 수 있습니다. 따라서 앞으로는 최종 답변의 정확성뿐 아니라 메모리의 사실성, 시간적 정합성, 오류 전파 여부도 함께 평가해야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
연속 비디오 스트림에서 자기지도학습이 어려운 이유
비전·비디오
cctest.ai
비전·비디오

연속 비디오 스트림에서 자기지도학습이 어려운 이유

프레임을 시간 순서대로 처리하고 전체 셔플이나 반복 재생을 허용하지 않으면 기존 시각 자기지도학습 방법의 성능이 크게 떨어진다. 연구진은 스트림에 맞춘 입력 처리와 정규화를 결합한 StreamMAE를 제안했다.

더 보기