평가 결과는 실제로 무엇을 입증할 수 있는가
특정 커밋에 고정한 Inspect Evals 전수 조사에서, 실행 가능한 평가 코드만으로는 지표에 연결된 과거의 주장까지 재현할 수 없다는 점이 드러났다. 기계적으로 대상이 된 124개 유닛 중 110개는 필요한 증거 또는 의미적 근거가 없어 결정적 추론에 들어가기 전에 중단됐다.
더 보기특정 커밋에 고정한 Inspect Evals 전수 조사에서, 실행 가능한 평가 코드만으로는 지표에 연결된 과거의 주장까지 재현할 수 없다는 점이 드러났다. 기계적으로 대상이 된 124개 유닛 중 110개는 필요한 증거 또는 의미적 근거가 없어 결정적 추론에 들어가기 전에 중단됐다.
더 보기UrbanGround는 홍콩 전역의 3D 지리공간 데이터로 상호작용 가능한 도시 샌드박스를 만들어, 멀티모달 모델이 국소적인 시각 이해를 장거리 이동과 지속적인 행동으로 연결할 수 있는지 평가한다. 현재 MLLM은 가까운 거리의 인식에는 강하지만, 긴 탐색에서는 방향 유지와 오류 수정이 불안정하다.
더 보기FIRM-Video는 텍스트-투-비디오 보상 모델이 점수를 매기기 전에 영상 속 근거를 확인하도록 설계된 체크리스트 기반 평가 방법이다. 지시 이행, 세계 일관성, 지각 품질을 세분화하고 90K 데이터셋과 벤치마크를 제시했다.
더 보기Video-IFBench는 동영상을 정확히 이해하는지를 넘어 시각·음성·의미·형식·조건 분기를 포함한 복잡한 지시를 따르는지 평가한다. 20개가 넘는 최신 MLLM을 대상으로 한 평가에서 동영상 지시 준수의 어려움이 드러났다.
더 보기AnTrap은 해결 가능한 Android 작업의 실행 과정에 현실적인 런타임 이상을 주입해 GUI 에이전트의 견고성을 평가한다. 실험 결과 대부분의 모델이 성능 저하를 보였으며, 학습으로 고칠 수 있는 오류와 더 깊은 추론 한계가 구분됐다.
더 보기VGI-Bench는 동영상 생성 모델을 화질이 아니라 변화하는 시각적 과정의 논리까지 평가한다. 현재 모델은 일부 추론 능력을 보이지만 안정성과 자기 수정에서는 여전히 한계를 드러냈다.
더 보기구글 딥마인드가 외부 기관들과 함께 모델 가중치와 평가 프롬프트를 서로 공개하지 않는 이중 블라인드 AI 평가를 시험한다. 기밀 컴퓨팅을 활용해 벤치마크 오염 위험을 줄이는 것이 목표다.
더 보기새 벤치마크는 단일 버그 수정이 아니라 저장소 전체의 기술 스택 마이그레이션 능력을 평가한다. 520회 실행 중 마이그레이션 감사와 동작 테스트, 추가 검증을 모두 통과한 비율은 5.4%에 불과했다.
더 보기FrontierChallenge는 그럴듯한 답변이 아니라 검증 가능한 과학 워크플로를 끝까지 납품할 수 있는지를 평가한다. 결과는 부분적인 진전과 완전한 완료 사이에 큰 격차가 있음을 보여준다.
더 보기ClawProBench는 최종 답변뿐 아니라 증거 수집, 런타임 라우팅, 안전 경계, 반복 실행의 안정성까지 평가한다. 결과는 네이티브 런타임 작업이 더 어렵고, 한 번의 성공만으로는 신뢰성을 판단하기 어렵다는 점을 보여준다.
더 보기Thinkingbox는 그럴듯한 답변이나 올바른 도구 호출을 넘어, 업무 흐름이 끝난 뒤 백엔드 상태가 요구사항과 일치하는지 검증합니다. 벤치마크 결과는 우연한 성공과 반복 가능한 실행 능력 사이에 큰 차이가 있음을 보여줍니다.
더 보기GameXpert-Bench는 코딩 에이전트의 게임 개발 능력을 생성, 버그 수정, 다중 턴 최적화의 전체 과정에서 평가한다. 에이전트는 플레이 가능한 기반을 만드는 데는 강하지만, 능동적인 결함 발견과 런타임 검증, 회귀 방지에는 여전히 약점을 보인다.
더 보기MobilePA-Bench는 단순한 화면 조작을 넘어 도구 호출, 장기 계획, 메모리, 복합 스킬, 서브에이전트 협업을 평가하는 인터랙티브 벤치마크입니다. 엄격한 도구 순서와 권한 제한, 실행 중 오류가 발생하면 최신 LLM의 신뢰성이 크게 떨어지는 것으로 나타났습니다.
더 보기LongRCA Bench는 장기 실행 에이전트의 실패를 책임 역할 식별과 가장 이른 결정적 근본 원인 단계 탐지라는 두 과제로 나눠 평가한다. 1,140개의 실제 실패 궤적과 학습이 필요 없는 RCTA 방법을 함께 제시했다.
더 보기모델과 프롬프트, 검색 정책을 그대로 유지해도 검색 인덱스를 확장하면 같은 질문에 대한 답변이 바뀔 수 있다는 연구 결과가 나왔다. 연구진은 일반적인 생성 변동성과 인덱스 업데이트의 영향을 분리하는 ‘스냅샷 호환성 감사’를 제안했다.
더 보기FlavourBench는 8개 식재료 중 3개를 고르는 조합 과제를 통해 오픈엔드 언어 모델을 평가한다. 버전이 고정된 요리 시스템이 가능한 56개 조합을 미리 채점해 평가의 재현성을 높였다.
더 보기새 연구는 하이브리드 추론 멀티모달 모델에서 사고 모드와 비사고 모드 사이에 뚜렷한 응답 행동 불일치가 나타난다고 분석했다. PatternEval과 PatternRL은 정확도만으로 포착하기 어려운 출력 실패를 측정하고 줄이기 위한 방법이다.
더 보기Hume AI의 연구는 자동 음성 인식 모델이 공개 벤치마크의 정답 문구를 재현하는 경향을 측정하는 방법을 제시했다. 일부 고득점 오픈소스 모델은 음성이 모순되거나 가려졌거나 모호한 상황에서도 참조 문장을 그대로 출력했다.
더 보기NARU는 일본어 장편 영상에서 변화하는 서사를 추적하고 명시되지 않은 문화적 의미를 추론하는 능력을 함께 평가하는 벤치마크다. 평가 결과, 현행 멀티모달 모델은 장거리 정보 통합과 문화적 맥락 기반 추론에서 여전히 큰 어려움을 보였다.
더 보기코딩 에이전트의 성공 여부는 모델이 어떤 명령을 생성했는지뿐 아니라, 실행 전에 그 명령이 어떻게 직렬화되고 포장되며 다시 파싱되는지에도 좌우됩니다. QuoteBench는 단일 매칭 점수가 인터페이스에서 발생한 실패를 가릴 수 있음을 측정했습니다.
더 보기그리스어 추론 실험은 정확도가 거의 변하지 않아도 모델의 행동은 크게 달라질 수 있음을 보여준다. SFT는 사용자 언어로 사고하게 만들고, RLVR은 형식 위반과 채널 누출을 고친다.
더 보기