아티클 목록으로
모델 평가

VeriPhy: 생성 영상의 물리적 신뢰성을 추적 가능하게 평가하다

약 3분 소요

생성 영상 모델은 한눈에 보기에 자연스러운 장면을 만드는 능력을 빠르게 높이고 있습니다. 그러나 시각적 유창함이 물리적 신뢰성을 보장하지는 않습니다. 객체가 중간에 비정상적으로 이동하거나, 프레임 사이에서 개수가 달라지거나, 프롬프트가 요구한 행동 순서가 뒤바뀔 수 있습니다. 전체 영상을 하나의 품질 점수로 평가하면 어떤 요구가 실패했는지, 그리고 실패가 언제 발생했는지 알기 어렵습니다.

VeriPhy는 영상 평가를 검증 워크플로로 바꾸는 접근을 취합니다. 시스템은 프레임을 보기 전에 텍스트 전용 플래너를 사용해 프롬프트를 타입이 지정된 물리적 의무로 컴파일합니다. 여기에는 참조된 객체의 존재, 수량, 공간적 관계, 움직임, 사건의 시간적 순서가 포함될 수 있습니다. 이어서 어떤 분석을 어떤 주장에 사용할지 정의한 실행 계획을 만들고 정적으로 검증합니다.

실행 단계에서 관측 결과는 이미 선언된 호출만 활성화하고 범위를 정합니다. 사용되는 저수준 전문가는 분할과 추적, 카운팅, 깊이 추정, OCR, 오디오 이벤트 검출 등입니다. 추적 결과에는 11가지 타입 기반 물리 측정도 적용됩니다. 각각의 작업은 provenance를 포함한 증거 레코드를 반환하며, 사용할 수 있는 결과는 타입이 지정된 측정값이거나 학습된 상태임을 명시적으로 표시합니다. 따라서 자유로운 모델 응답보다 중간 판단을 점검하기 쉽습니다.

핵심 포인트

  • 프롬프트를 먼저 명시적인 물리적 의무로 컴파일한다.
  • 평가 중 임의의 도구 호출을 허용하지 않고 선언된 분석으로 제한한다.
  • 관측부터 최종 판정까지의 증거 경로를 보존한다.
  • 지원, 모순, 미지의 세 값으로 불확실성을 표현한다.
  • 참조, 공간, 시간에서 발생한 실제 생성 결함을 평가한다.

평가에는 1500개 영상과 사람이 주석을 단 결함 기록으로 구성된 코퍼스가 사용됐습니다. 149개 영상으로 이뤄진 핵심 세트에는 304개의 기록이 있었고, VeriPhy는 이 중 228개를 포착했습니다. 같은 영상과 주장을 사용한 기존 질문 분해 평가기는 164개, 동일 백본에 단일 프롬프트를 적용한 방식은 222개를 기록했습니다. 다만 재현율만으로 두 접근법을 완전히 구분할 수는 없습니다. VeriPhy의 핵심적인 차이는 각 결론에 증거 레코드와 provenance를 남겨 사례별 감사를 가능하게 한다는 데 있습니다.

이 구조는 월드 모델을 개선하는 과정에서도 의미가 있습니다. 평가기가 어떤 객체, 관계, 시점에서 실패했는지 알려준다면 해당 진단을 다음 생성 과정에 연결할 수 있기 때문입니다. 또한 근거가 부족할 때 이를 억지로 성공이나 실패로 분류하지 않고 미지 또는 abstain으로 남기는 설계도 중요합니다. 제공된 자료만으로 모든 물리 법칙이나 복잡한 장면에서의 안정성을 확인할 수는 없습니다. 그럼에도 VeriPhy는 불투명한 점수 중심 평가를 넘어, 제약 조건과 도구 호출, 증거의 연결을 갖춘 감사 가능한 평가 시스템으로 나아가는 구체적인 방식을 보여줍니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Principia, 영상 모델이 물리 법칙을 이해하는지 관계성으로 검증
모델 평가
cctest.ai
모델 평가

Principia, 영상 모델이 물리 법칙을 이해하는지 관계성으로 검증

영상 생성 모델은 자연스러운 움직임을 만들 수 있지만 기본적인 물리 법칙을 지킨다는 뜻은 아닙니다. Principia는 같은 장면 속 물체들의 관계를 이용해 카메라 보정 없이 물리적 일관성을 평가합니다.

더 보기
CCTest · Blog
S³Gym: LLM은 자기 테스트와 자기 평가로 실제 개선할 수 있을까
모델 평가
cctest.ai
모델 평가

S³Gym: LLM은 자기 테스트와 자기 평가로 실제 개선할 수 있을까

S³Gym은 LLM 에이전트가 자신의 행동을 시험하고 경험을 판단한 뒤 이후 의사결정을 개선할 수 있는지 평가하는 대화형 벤치마크입니다. 연구 결과, 경험의 효과는 과제 구조와 저장 방식에 크게 좌우되는 것으로 나타났습니다.

더 보기
CCTest · Blog
ExecRetrieval이 드러낸 코드 검색의 ‘유사성’과 ‘정확성’의 간극
모델 평가
cctest.ai
모델 평가

ExecRetrieval이 드러낸 코드 검색의 ‘유사성’과 ‘정확성’의 간극

ExecRetrieval은 정답 구현과 거의 동일하게 보이지만 실행 결과가 틀린 코드 변형을 검색 후보에 함께 넣어, 코드 임베딩의 기능적 판별 능력을 측정한다. 정답을 상위권에서 찾는 것과 1위로 고르는 것 사이에는 큰 차이가 나타났다.

더 보기