APM-Bench, 1인칭 영상 비서의 세션 간 기억을 평가하다
들어가며
스마트 안경 비서가 하나의 연속 영상만 이해한다면, 개인 비서라기보다 단기 관찰 도구에 가깝습니다. 실제 사용은 중단과 재개를 반복합니다. 사용자가 기기를 껐다가 몇 시간 또는 며칠 뒤 다시 질문할 수 있으며, 답변을 위해서는 이전 세션에서 본 시각 정보가 필요할 수 있습니다. APM-Bench는 바로 이 세션 간 기억 문제를 중심으로 스트리밍 영상 비서를 평가합니다.
단일 영상 이해를 넘어
기존 스트리밍 영상 벤치마크와 방법은 하나의 연속 영상이나 짧은 클립을 주로 다룹니다. 현재 컨텍스트에 정보가 남아 있는 상태에서 물체와 행동을 인식하고 질문에 답할 수 있는지를 측정하는 방식입니다. 그러나 실제 개인 비서에는 추가적인 문제가 있습니다. 세션이 끝날 때 무엇을 저장해야 하는지, 다음 세션에서 과거 기억을 언제 불러와야 하는지, 필요한 증거가 저장되지 않았다면 이를 인정할 수 있는지가 중요합니다.
APM-Bench는 실제 상호작용을 여러 세션으로 이루어진 생활 궤적으로 재구성합니다. 데이터는 549개 세션, 104개 궤적, 2,719개 후보로 구성됩니다. 각 세션은 세밀한 주석이 달린 영상이며, 같은 궤적에 속한 세션들은 서로 관련된 활동을 중심으로 연결됩니다. 명확한 답을 요구하는 객관적 질문뿐 아니라 맥락적 판단이 필요한 개방형 질문도 포함합니다. 과거 경험을 바탕으로 이후 상호작용에서 선제적인 응답을 제공할 수 있는지도 살펴봅니다.
핵심 평가 항목
- 세션 간 회수: 이전 세션에서 현재 질문과 관련된 시각적 증거를 찾을 수 있는가.
- 기억 관리: 제한된 용량 안에서 중요한 정보를 선택적으로 보존하는가.
- 기억 주입 시점: 과거 정보를 추론 과정에 언제 넣어야 하는가.
- 효율성: 답변 품질 향상에 비해 지연과 저장 비용이 얼마나 늘어나는가.
- 증거 인식: 필요한 정보가 없을 때 추측하지 않고 부족한 증거를 인정하는가.
연구는 다양한 기억 프로토콜을 적용한 일반 영상 모델과 스트리밍 환경을 위해 설계된 전문 메모리 시스템을 비교합니다. 요약된 결과는 효용, 지연, 저장 공간 사이에 뚜렷한 상충 관계가 있음을 보여줍니다. 장기 회수의 신뢰성을 높이면 계산 및 저장 부담이 커질 수 있고, 비용을 지나치게 줄이면 답변의 신뢰성이 떨어질 수 있습니다.
의미와 영향
APM-Bench의 의미는 기억을 단순히 긴 영상 컨텍스트로 정의하지 않는 데 있습니다. 정보를 저장하고, 선택적으로 남기고, 검색하고, 적절한 시점에 주입하며, 증거가 없을 때 답변을 보류하는 전체 과정이 평가 대상입니다. 개인 비서에게 필요한 것은 모든 것을 기억하는 능력이 아닙니다. 미래에 유용할 증거를 관리 가능한 비용으로 보존하고, 필요할 때 활용하며, 근거가 없을 때 솔직하게 대응하는 능력입니다.
이 관점은 실시간 지각, 기억 모듈, 상호작용 정책을 함께 설계해야 한다는 점도 보여줍니다. 웨어러블과 장기 사용형 영상 비서가 발전할수록, 세션 간 기억을 평가하는 벤치마크는 실제 유용성을 판단하는 중요한 기준이 될 수 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…