아티클 목록으로
AI 에이전트

Video-DeepResearch: 연속 비디오를 위한 차세대 멀티모달 연구 에이전트

약 2분 소요

소개

Video-DeepResearch(Video-DR)는 입력이 이미지나 문서가 아니라 시간적으로 이어지는 비디오 스트림일 때, 멀티모달 연구 에이전트를 어떻게 설계해야 하는지를 다룬다. 저자들은 비디오 이해에는 긴 컨텍스트만으로는 부족하며, 프레임을 넘나드는 촘촘한 시공간 grounding 이 필요하다고 본다.

핵심 내용

  • 먼저 보고, 그다음 검색: 감지와 탐색을 분리하고 도구를 단계적으로 열어, 모델이 비디오를 충분히 본 뒤에만 외부 웹 검색을 하게 만든다.
  • 모달리티 편향 완화: 현재 모델은 시각 도구가 가능해도 텍스트 검색으로 우회하는 경향이 있다. Video-DR는 이 지름길을 구조적으로 막으려 한다.
  • 파라메트릭 지식 누출 억제: 내부 기억만으로 답하지 않고, 실제 도구를 쓰는 실행 과정을 강제한다.
  • 2단계 학습: 먼저 지도 미세조정(SFT)으로 기본 행동을 익히고, 이후 GRPO로 더 자율적인 도구 사용을 학습한다.
  • 새 벤치마크: 인간-AI 협업 방식의 200개 복합 다단계 VQA 사례로 구성된 Video-DR-Bench를 제시한다.
  • 보고된 성능: Video-DeepResearch-35B-A3B는 평균 64.0%를 기록했고, 30B-A3B 버전은 59.3%를 달성했다고 설명한다.

의미

이 작업의 포인트는 단순히 비디오 질문응답 정확도를 높이는 데 있지 않다. 진짜 목표는 비디오 위에서 증거를 수집하고 검증하며 필요한 경우에만 검색하는, 말 그대로 연구 에이전트다운 행동을 구현하는 것이다.

멀티모달 에이전트의 다음 단계는 더 큰 모델만이 아니라, 더 나은 절차와 더 강한 행동 제약일 수 있다. Video-DR은 그 방향을 비디오 영역에서 구체적으로 보여준다.

출처

Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Skill-α: 강화학습으로 AI 에이전트 스킬을 점진적으로 생성하다
AI 에이전트
cctest.ai
AI 에이전트

Skill-α: 강화학습으로 AI 에이전트 스킬을 점진적으로 생성하다

Skill-α는 에이전트 스킬 생성을 한 번의 작성이 아니라 순차적 편집 과정으로 정의하고, 각 편집이 실제 하위 작업 성능을 높이는지 평가한다. 문서 기반과 경험 기반 스킬 생성 모두에서 기존 휴리스틱 및 파이프라인 방식보다 나은 결과를 보였다.

더 보기
CCTest · Blog
SKT: 검증된 합성 데이터로 AI 에이전트의 스킬 활용을 훈련
AI 에이전트
cctest.ai
AI 에이전트

SKT: 검증된 합성 데이터로 AI 에이전트의 스킬 활용을 훈련

SKT는 언어모델 에이전트가 재사용 가능한 스킬을 더 잘 찾고, 적용하고, 조합하도록 돕는 검증형 데이터 합성 파이프라인이다. 공개 스킬을 바탕으로 실행 가능한 과제와 궤적을 만들고, 검증을 통과한 데이터만 학습에 활용한다.

더 보기