Video-DeepResearch: 연속 비디오를 위한 차세대 멀티모달 연구 에이전트
약 2분 소요
소개
Video-DeepResearch(Video-DR)는 입력이 이미지나 문서가 아니라 시간적으로 이어지는 비디오 스트림일 때, 멀티모달 연구 에이전트를 어떻게 설계해야 하는지를 다룬다. 저자들은 비디오 이해에는 긴 컨텍스트만으로는 부족하며, 프레임을 넘나드는 촘촘한 시공간 grounding 이 필요하다고 본다.
핵심 내용
- 먼저 보고, 그다음 검색: 감지와 탐색을 분리하고 도구를 단계적으로 열어, 모델이 비디오를 충분히 본 뒤에만 외부 웹 검색을 하게 만든다.
- 모달리티 편향 완화: 현재 모델은 시각 도구가 가능해도 텍스트 검색으로 우회하는 경향이 있다. Video-DR는 이 지름길을 구조적으로 막으려 한다.
- 파라메트릭 지식 누출 억제: 내부 기억만으로 답하지 않고, 실제 도구를 쓰는 실행 과정을 강제한다.
- 2단계 학습: 먼저 지도 미세조정(SFT)으로 기본 행동을 익히고, 이후 GRPO로 더 자율적인 도구 사용을 학습한다.
- 새 벤치마크: 인간-AI 협업 방식의 200개 복합 다단계 VQA 사례로 구성된 Video-DR-Bench를 제시한다.
- 보고된 성능: Video-DeepResearch-35B-A3B는 평균 64.0%를 기록했고, 30B-A3B 버전은 59.3%를 달성했다고 설명한다.
의미
이 작업의 포인트는 단순히 비디오 질문응답 정확도를 높이는 데 있지 않다. 진짜 목표는 비디오 위에서 증거를 수집하고 검증하며 필요한 경우에만 검색하는, 말 그대로 연구 에이전트다운 행동을 구현하는 것이다.
멀티모달 에이전트의 다음 단계는 더 큰 모델만이 아니라, 더 나은 절차와 더 강한 행동 제약일 수 있다. Video-DR은 그 방향을 비디오 영역에서 구체적으로 보여준다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…