Harbor, 80개 이상 에이전트 벤치마크를 하나로 묶다
Harbor Adapters는 80개가 넘는 에이전트 벤치마크를 공통 평가 인프라에 연결하고, Harbor-Index는 그중 어려운 82개 과제를 선별합니다.
더 보기Harbor Adapters는 80개가 넘는 에이전트 벤치마크를 공통 평가 인프라에 연결하고, Harbor-Index는 그중 어려운 82개 과제를 선별합니다.
더 보기PerfReasoning은 하드웨어 성능에 대한 직접 추론과 분석용 성능 모델 코드 생성을 পৃথ도로 평가하는 벤치마크다. 결과는 그럴듯한 설명을 만드는 능력과 신뢰할 수 있는 성능 모델을 구축하는 능력 사이에 큰 격차가 있음을 보여준다.
더 보기HarvestBench는 동물을 그대로 치고 지나가는 대신 연료를 내고 우회할지 묻는 방식으로 LLM 에이전트의 실제 행동을 평가한다. 모델별 살상률 차이는 매우 컸고, 도덕적 지시문은 결과를 크게 바꿨다.
더 보기매끄럽게 보이는 생성 영상도 객체 수, 공간 관계, 사건의 순서를 틀릴 수 있습니다. VeriPhy는 프롬프트를 타입이 지정된 물리적 의무로 변환하고, 판단의 근거까지 추적할 수 있는 평가 결과를 제공합니다.
더 보기음성 뇌-컴퓨터 인터페이스는 데이터셋, 어휘, 평가 지표가 서로 달라 연구 결과를 직접 비교하기 어렵습니다. 새로운 개방형 어휘 상호정보량(OVMI)은 디코딩 정확도와 사용자의 언어를 얼마나 폭넓게 지원하는지를 함께 평가합니다.
더 보기영상 생성 모델은 자연스러운 움직임을 만들 수 있지만 기본적인 물리 법칙을 지킨다는 뜻은 아닙니다. Principia는 같은 장면 속 물체들의 관계를 이용해 카메라 보정 없이 물리적 일관성을 평가합니다.
더 보기AFAC2026에는 5,027개 팀과 약 2만 명이 참가해 시장 분석, 금융 문서, 자동화 실험, 장문 Agent 과제를 수행했습니다. 대회는 금융 AI의 평가 기준이 단일 정확도에서 실제 운영 능력으로 이동하고 있음을 보여줍니다.
더 보기ExecRetrieval은 정답 구현과 거의 동일하게 보이지만 실행 결과가 틀린 코드 변형을 검색 후보에 함께 넣어, 코드 임베딩의 기능적 판별 능력을 측정한다. 정답을 상위권에서 찾는 것과 1위로 고르는 것 사이에는 큰 차이가 나타났다.
더 보기S³Gym은 LLM 에이전트가 자신의 행동을 시험하고 경험을 판단한 뒤 이후 의사결정을 개선할 수 있는지 평가하는 대화형 벤치마크입니다. 연구 결과, 경험의 효과는 과제 구조와 저장 방식에 크게 좌우되는 것으로 나타났습니다.
더 보기새 연구가 도메인 지식 부족과 실행 능력 부족을 구분하기 위한 지식 게이트형 작업 구성 프로토콜을 제안했다. 비공개 지식 아티팩트의 제공 여부를 엄격히 비교해 일부 작업에서 뚜렷한 의존성을 확인했지만, 후속 학습 효과까지 입증한 것은 아니다.
더 보기EarlyEval은 LLM 에이전트의 중간 행동과 텍스트를 분석해 작업의 성공 또는 실패를 조기에 예측한다. 세 가지 벤치마크에서 평가 결과의 변화는 작게 유지하면서 실행 단계와 토큰 사용량을 줄였다.
더 보기SWE-bench의 문제는 대체로 정형화되고 정보가 풍부하지만, 실제 사용자의 요청은 짧고 구어체이며 맥락이 부족한 경우가 많습니다. RealSWE는 현실적인 입력이 평균 해결률을 낮추고 모델 순위까지 바꿀 수 있음을 보여줍니다.
더 보기E-Commerce Bench는 LLM 에이전트가 365일 동안 조달 협상, 판매, 주문 처리, 반품, 현금흐름 관리를 수행하도록 설계된 평가 벤치마크입니다. 높은 수익과 종합적인 운영 역량은 서로 다를 수 있다는 결과를 보여줍니다.
더 보기AgentJudgeBench는 개방형 텍스트 선호도가 아니라 의존 관계가 있는 도구 호출 워크플로에서 LLM 평가자를 시험한다. 결과는 평가 신뢰성이 모델 규모보다 작업 난도에 더 크게 좌우될 수 있음을 보여준다.
더 보기SpanCalib-VLM은 생성형 비전언어 모델과 멀티모달 시퀀스 태거를 결합해 환각 텍스트 구간을 찾고 confidence를 재보정합니다. SHROOM-Visions 영어 평가 분할에서 구간 검출과 점수 신뢰도를 함께 다루는 방식을 제시했습니다.
더 보기FACE-Eval 연구는 선호 단서가 어디에, 얼마나 명시적으로 전달되는지가 모델의 사고 과정 충실성에 큰 영향을 준다고 보고했다. 도구 반환값이나 원시 자료에 숨은 단서는 추론 텍스트에 드러나지 않은 채 답변에 반영될 가능성이 높았다.
더 보기하나의 벤치마크 점수에는 안전성뿐 아니라 추론과 지식 이해의 신호도 섞일 수 있습니다. Ai2의 BenchMIRT는 다차원 문항반응이론으로 이를 문항 단위에서 분해합니다.
더 보기EASEL은 멀티모달 모델이 이미지를 이해하는 데서 그치지 않고, 시각적 피드백을 바탕으로 도구 사용을 계속 수정할 수 있는지 평가한다. 핵심 과제는 참조 이미지와 같아지도록 캔버스를 단계적으로 그리는 것이다.
더 보기LoopArena는 코딩 에이전트를 움직이는 제어 루프를 분리해, 한 모델이 다른 고정 코딩 에이전트를 장기 소프트웨어 작업에서 얼마나 잘 이끌 수 있는지 측정합니다. 결과는 안정적인 장기 제어가 여전히 어려운 과제임을 보여줍니다.
더 보기새로운 벤치마크 GMA는 오픈소스 프로젝트를 기반으로 한 7개 앱과 300개 과제를 통해 단일 조작부터 다단계 워크플로까지 모바일 에이전트를 평가한다. 과제가 복잡해질수록 성능이 크게 하락했지만, 컨텍스트 유지와 명시적 상태 추적을 포함한 하니스 설계는 일부 어려운 작업의 수행을 개선할 수 있었다.
더 보기특정 커밋에 고정한 Inspect Evals 전수 조사에서, 실행 가능한 평가 코드만으로는 지표에 연결된 과거의 주장까지 재현할 수 없다는 점이 드러났다. 기계적으로 대상이 된 124개 유닛 중 110개는 필요한 증거 또는 의미적 근거가 없어 결정적 추론에 들어가기 전에 중단됐다.
더 보기