ExtractBench: 기업 문서 스키마 기반 추출을 평가하는 벤치마크
ExtractBench는 사용자 정의 스키마에 따라 기업 문서에서 구조화 데이터를 추출하는 에이전트를 평가한다. 값의 정확도뿐 아니라 레코드 완전성, 근거 추적성, 실제 비용까지 함께 측정한다.
더 보기ExtractBench는 사용자 정의 스키마에 따라 기업 문서에서 구조화 데이터를 추출하는 에이전트를 평가한다. 값의 정확도뿐 아니라 레코드 완전성, 근거 추적성, 실제 비용까지 함께 측정한다.
더 보기See2Think는 멀티모달 대형 언어 모델이 추론 중 생성하는 스케치, 주석, 중간 이미지를 실제로 의사결정에 사용하는지 검증하는 평가 프레임워크다.
더 보기StealthBench는 자율 offensive-security agents를 단순히 취약점을 찾는 능력이 아니라, 노출과 피해를 줄이며 임무를 수행하는 능력으로 평가한다. 논문 결과는 현재 모델들이 OPSEC 측면에서 아직 안정적이지 않음을 보여준다.
더 보기SecRespond는 침해된 호스트의 포렌식 디스크 스냅샷과 보안 제품 증거를 바탕으로 AI 에이전트의 사고 대응 능력을 평가하는 벤치마크입니다. 연구 결과, 현재 모델은 명시적 경고는 비교적 잘 따라가지만 조용한 침입 탐지와 완전한 복구 계획에는 한계를 보였습니다.
더 보기새 논문은 미발표 고품질 논문의 핵심 연구 질문을 AI 에이전트에 맡기고 원저자가 평가하는 ‘섀도 평가’를 제안했다. 결과는 현재 에이전트가 엔지니어링은 해내지만, 개방형 연구의 핵심 판단에는 여전히 취약하다는 점을 보여준다.
더 보기DataPrep-Bench는 LLM, 에이전트, 데이터 워크플로가 학습 데이터를 얼마나 잘 준비하는지 하위 학습 성능으로 평가하는 벤치마크입니다. 텍스트의 표면적 품질보다 실제 훈련 효용에 초점을 맞춥니다.
더 보기SceneActBench는 3D 장면을 설명하는 능력이 아니라, 그 장면 안에서 올바른 행동 결과를 만들어내는 능력을 평가한다. 이미지나 비디오 프레임을 기반으로 VLM 에이전트의 공간 이해와 3D 행동 능력을 기하학적 지표로 측정한다.
더 보기새 논문은 단일 턴 벤치마크에서 강한 성능을 보이는 LLM이라도 실제 대화에서 계속 바뀌는 사용자 의도를 안정적으로 추적하지 못할 수 있다고 지적한다. 연구진은 기존 정적 과제를 동적 다중 턴 대화로 바꾸는 평가 프레임워크를 제안했다.
더 보기ProVisE는 공간 과제가 항상 텍스트나 좌표로 답하기 적합하지 않다는 문제에서 출발한다. 이미지 생성 모델이 픽셀 위에 표시하거나 경로를 그리도록 하고, 이를 기존 벤치마크가 채점할 수 있는 구조화된 예측으로 변환한다.
더 보기Tencent WorkBuddy Bench는 코드, 웹, 오피스, 보안 영역에서 코딩 에이전트의 업무 수행 능력을 평가하는 벤치마크다. 공개 재현성을 유지하면서도 오염에 강한 태스크 구성 방식을 내세운 점이 핵심이다.
더 보기ActiveVision은 멀티모달 대형언어모델이 한 번 보고 답하는 수준을 넘어, 관찰과 추론, 재확인을 반복할 수 있는지 평가하는 벤치마크다. 논문은 최신 모델과 인간 사이의 큰 격차를 보고한다.
더 보기GAMUT은 모델 답변이 틀리지 않았는지를 넘어, 필요한 사실을 충분히 포함했는지를 평가하는 벤치마크입니다. 두 단계 메타 루브릭을 통해 개방형 장문 답변의 누락 문제를 체계적으로 측정합니다.
더 보기Apple-PI는 영상이 그럴듯한지만 보지 않고, 물리 법칙을 따라 생성됐는지도 묻는 벤치마크입니다. 결과뿐 아니라 그에 이르는 추론 과정까지 함께 평가합니다.
더 보기이 논문은 보안 에이전트 평가에서 최고 성공률만 보는 방식의 한계를 지적하고, 비용 대비 성공이라는 관점을 제안한다. 공격형 과제와 방어형 SOC 조사 과제는 확장 양상이 서로 다르게 나타났다.
더 보기VIABench는 시각장애인이 직접 촬영하거나 공유한 1인칭 영상을 바탕으로, 멀티모달 대형 언어모델이 실제 보조 상황에서 얼마나 유용한지 평가한다.
더 보기Stripe가 실제 결제 통합 환경에 가까운 AI 에이전트 벤치마크를 공개했다. 결과는 에이전트가 코드 작성과 일부 백엔드 통합에서는 진전했지만, 엔드투엔드 검증과 상태 관리, 오류 복구에서는 여전히 취약하다는 점을 보여준다.
더 보기OpenAI CFO Sarah Friar는 AI 투자수익률을 평가하기 위한 실무형 스코어카드를 제시했다. 핵심은 화려한 시연이 아니라 유용한 작업, 성공한 작업당 비용, 신뢰성, 컴퓨트 투자 대비 수익이다.
더 보기이 논문은 현재 AI 침투 테스트 Agent 평가가 지나치게 통제된 과제에 의존한다고 지적한다. 저자들은 실제 취약점 발견과 검증을 중심으로 한 더 현실적인 평가 프로토콜을 제안한다.
더 보기VentureBeat Pulse Research가 157개 기업을 조사한 결과, 기업들은 AI Agent에 더 많은 자율성을 부여하면서도 이를 통제할 평가 체계는 충분히 신뢰하지 못하는 것으로 나타났다. 핵심은 평가 범위보다 실제 고객 환경과의 불일치다.
더 보기Hugging Face Blog 글은 최신 OCR 모델이 항상 특정 업무에서 더 낫지는 않다는 점을 보여준다. 브라질 포르투갈어에 특화된 DharmaOCR는 전용 벤치마크에서 Mistral OCR4와 Unlimited-OCR보다 높은 점수를 기록했다.
더 보기ACM MM 2026에 채택된 한 논문은 비디오 LLM의 벤치마크 정확도가 곧 시각 이해를 뜻하지는 않는다고 지적한다. 연구진은 원본 비디오와 검은 화면 입력의 정답 차이를 측정하는 Visual Dependency Gap, 즉 VDG를 제안했다.
더 보기