프로그램 검증으로 더 신뢰할 수 있는 비전·언어 모델 자기진화
배경
라벨이 없는 이미지로 비전·언어 모델을 자기진화시키려면 질문을 많이 만드는 것만으로는 부족합니다. 생성된 질문에 신뢰할 수 있는 답을 붙여야 하며, 그렇지 않으면 잘못된 감독 신호가 다음 학습에 반복해서 들어갈 수 있습니다. 기존 방법은 여러 번 샘플링한 답변의 다수결을 사용하거나 다른 모델을 심판으로 활용합니다. 그러나 모델들이 같은 시각적 편향을 공유한다면 틀린 답도 다수가 될 수 있습니다.
MBZUAI 연구진은 이 문제를 해결하기 위해 VQS(Verifiable QA Generation for Self-Evolving Models)를 제안했습니다. 핵심은 모델에게 완성된 답변 중 무엇이 가장 좋은지 묻게 하는 대신, 답변에 사용된 짧고 명확한 사실을 하나씩 확인하게 만드는 것입니다. 구현 코드도 공개됐습니다.
구조화와 프로그램 계산
VQS는 이미지 이해와 질문 생성, 답변 계산을 분리합니다.
- 이미지 파싱: 이미지를 장면 그래프, 차트 표, 다이어그램의 관계 그래프 같은 구조화된 기록으로 변환합니다.
- 프로그램 기반 생성: 고정 프로그램이 기록에서 질문을 만들고 필요한 항목을 이용해 답을 계산합니다. 답을 언어 모델의 자유로운 추측에만 의존하지 않습니다.
- 개별 주장 확인: 모델은 프로그램이 실제로 사용한 짧은 시각적 사실만 검사합니다. 특정 물체가 있는지, 어떤 값이 특정 행에 속하는지 등을 확인하는 방식입니다.
이러한 주장 단위 검증 결과는 이미지 파서의 학습 목표를 고르는 데에도 활용됩니다. 따라서 파서는 별도의 정답 라벨이 없는 이미지에서도 점진적으로 개선될 수 있습니다. 인식, 구조화, 검증 가능한 질문 응답이 순환하는 구조입니다.
오류를 줄이는 이유
다수결은 가장 많이 나온 답이 맞을 가능성이 높다는 가정에 기대고 있습니다. 하지만 여러 샘플이 같은 오인식을 공유하면 이 가정은 무너집니다. 모델 심판 방식도 답변 표현, 추론 방식, 심판 모델 자체의 지각 오류에 영향을 받을 수 있습니다.
VQS는 판단 범위를 줄입니다. 관계 조합이나 계산처럼 프로그램이 안정적으로 처리할 수 있는 작업은 고정 코드에 맡기고, 모델은 이미지에서 읽어야 하는 사실만 확인합니다. 논문이 보고한 사람 평가에서 VQS 답변의 정답률은 94%였으며, 다수결 방식은 76%였습니다. 자기진화 과정에서 생성된 라벨을 검사했을 때는 다수결 라벨의 24%, 모델 심판 라벨의 18%가 잘못된 것으로 나타났습니다. 이는 합성 데이터의 양을 늘리는 것뿐 아니라 감독 신호의 품질을 관리하는 일이 중요하다는 점을 보여줍니다.
성능과 의미
10개 벤치마크에서 VQS는 2B, 4B, 8B 규모의 Qwen3-VL을 최대 3.18포인트 향상시켰고, 각 규모에서 가장 강한 자기진화 기준선을 넘어섰습니다. 세 차례 학습을 진행했을 때 2B 모델의 향상 폭은 3.84포인트까지 커졌습니다. 일회성 필터링이 아니라 반복적인 자기학습에 활용될 가능성을 보여주는 결과입니다.
VQS의 broader한 의미는 멀티모달 자기학습의 역할을 나누는 데 있습니다. 모델은 이미지를 이해하고 구조를 제안하며, 고정 프로그램은 검증 가능한 생성과 계산을 담당하고, 모델은 필요한 시각적 사실만 확인합니다. 파싱 오류를 완전히 없애는 방법은 아니지만, 오류가 발생할 수 있는 지점을 작고 점검 가능한 단위로 나눌 수 있습니다. 사람의 라벨이 부족한 시각 질의응답에서는 이런 프로그램 제약형 검증이 유망한 방향이 될 수 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…