아티클 목록으로
멀티모달

OneSearch-VL, 증거 그래프로 이미지·영상 딥리서치 통합

약 3분 소요

들어가며

한 장의 이미지를 설명하는 일과 여러 이미지 또는 영상에 대해 조사형 답변을 만드는 일은 서로 다른 작업입니다. 후자의 경우 모델은 화면 속 단서를 찾아야 하고, 관련 엔티티를 식별한 뒤 외부 검색으로 정보를 보완해야 합니다. 이어 검색 결과를 특정 시각 증거와 연결하고, 여러 사실을 하나의 답변으로 구성해야 합니다. OneSearch-VL은 이 과정을 하나의 멀티모달 연구 에이전트로 통합하려는 접근입니다.

핵심 구조: 시각 근거 증거 그래프

OneSearch-VL의 중심에는 Visually Grounded Evidence Graph, 즉 VGEG가 있습니다. VGEG는 최종 답변만 저장하지 않습니다. 이미지나 영상의 특정 위치에 있는 시각 앵커, 앵커와 연결된 엔티티 및 관계, 외부 출처가 뒷받침하는 사실, 그리고 답변을 만들어 내는 작업 사이의 의존성을 함께 표현합니다.

멀티모달 연구 시스템은 관련 있어 보이는 자료를 찾고도 그것이 화면 속 어떤 대상이나 장면을 설명하는지 명확히 연결하지 못할 수 있습니다. 반대로 모델이 시각 입력보다 언어적 사전지식이나 검색 결과에 의존해 그럴듯한 결론을 낼 가능성도 있습니다. VGEG는 이러한 연결을 명시해 데이터 구축, 과정 감독, 세부 평가에서 공통으로 사용할 수 있는 작업 수준의 기준을 제공합니다.

학습 데이터와 평가 방식

연구팀은 VGEG 기반 데이터 엔진을 사용해 여러 이미지와 영상 질문을 만들고 검증했으며, 전문가 궤적을 선별했습니다. 이를 바탕으로 다음과 같은 학습 자원을 구성했습니다.

  • 지도 미세조정용 OneSearch-VL-SFT-110K
  • 강화학습용 OneSearch-VL-RL-10K

또한 VGEG 주석에서 Evidence-aware Visual-Grounded Rubric, 즉 EVGR 보상을 도출했습니다. 이 보상은 단순히 정답 여부만 평가하지 않습니다. 모델의 주장이 관련 증거까지 추적되는지, 그리고 실제로 시각 정보를 활용해 답변했는지를 강화하는 데 초점을 둡니다.

평가를 위해 OneSearch-MI-Bench와 OneSearch-Video-Bench도 만들었습니다. 두 벤치마크는 VGEG에 기록된 연구 작업을 기준으로 질문을 정리합니다. 따라서 모델의 실패가 시각 위치 파악, 엔티티 연결, 검색, 증거 통합, 답변 생성 중 어느 단계에서 발생했는지 단일 종합 점수보다 구체적으로 분석할 수 있습니다.

결과와 의미

제공된 자료에 따르면 OneSearch-VL-8B는 두 신규 벤치마크에서 도구 사용이 가능한 Qwen3-VL-8B보다 각각 20.2포인트와 17.6포인트 높은 결과를 기록했습니다. 또한 7개 이미지 벤치마크와 VideoDR에서도 상당한 향상이 보고되었습니다. 이 결과의 핵심은 모델 규모만이 아니라, 유창한 답변 생성에서 한 단계 더 나아가 증거의 흐름을 따라 조사하도록 학습 목표를 확장했다는 점입니다.

단일 이미지, 여러 이미지, 영상은 서로 다른 시각 연산을 요구하지만 시각 grounding, 외부 정보 검색, 사실 조합이라는 공통 흐름을 공유합니다. VGEG 같은 중간 표현은 모달리티가 달라져도 이 의존성을 보존하고, 멀티모달 에이전트의 오류 분석을 더 구체적으로 만드는 데 도움이 될 수 있습니다.

다만 현재 제공된 자료만으로는 서로 다른 검색 도구, 노이즈가 많은 공개 정보, 더 긴 영상에서의 실제 성능까지 판단하기 어렵습니다. 공개된 코드와 데이터, 그리고 후속 재현 실험을 통해 일반화 성능을 확인해야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Kandinsky 6.0 Video, 영상·음성·립싱크를 한 번에 생성
멀티모달
cctest.ai
멀티모달

Kandinsky 6.0 Video, 영상·음성·립싱크를 한 번에 생성

Kandinsky 6.0 Video는 텍스트나 이미지를 입력해 44kHz 음성과 립싱크가 맞는 약 5초 길이의 영상을 생성하는 모델군입니다. 영상 스트림과 음성 스트림을 양방향으로 연결하는 CrossDiT 구조로 시간적·의미적 정합성을 높입니다.

더 보기