아티클 & 가이드

모델 평가

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 78개의 아티클

CCTest · Blog
평가 결과는 실제로 무엇을 입증할 수 있는가
모델 평가
cctest.ai
모델 평가

평가 결과는 실제로 무엇을 입증할 수 있는가

특정 커밋에 고정한 Inspect Evals 전수 조사에서, 실행 가능한 평가 코드만으로는 지표에 연결된 과거의 주장까지 재현할 수 없다는 점이 드러났다. 기계적으로 대상이 된 124개 유닛 중 110개는 필요한 증거 또는 의미적 근거가 없어 결정적 추론에 들어가기 전에 중단됐다.

더 보기
CCTest · Blog
UrbanGround, 실제 규모 도시에서 멀티모달 에이전트의 공간 능력을 검증하다
모델 평가
cctest.ai
모델 평가

UrbanGround, 실제 규모 도시에서 멀티모달 에이전트의 공간 능력을 검증하다

UrbanGround는 홍콩 전역의 3D 지리공간 데이터로 상호작용 가능한 도시 샌드박스를 만들어, 멀티모달 모델이 국소적인 시각 이해를 장거리 이동과 지속적인 행동으로 연결할 수 있는지 평가한다. 현재 MLLM은 가까운 거리의 인식에는 강하지만, 긴 탐색에서는 방향 유지와 오류 수정이 불안정하다.

더 보기
CCTest · Blog
FIRM-Video: 영상 생성 평가를 위한 ‘확인 후 채점’ 프레임워크
모델 평가
cctest.ai
모델 평가

FIRM-Video: 영상 생성 평가를 위한 ‘확인 후 채점’ 프레임워크

FIRM-Video는 텍스트-투-비디오 보상 모델이 점수를 매기기 전에 영상 속 근거를 확인하도록 설계된 체크리스트 기반 평가 방법이다. 지시 이행, 세계 일관성, 지각 품질을 세분화하고 90K 데이터셋과 벤치마크를 제시했다.

더 보기
CCTest · Blog
Video-IFBench, 동영상 멀티모달 모델의 지시 준수 능력 평가
모델 평가
cctest.ai
모델 평가

Video-IFBench, 동영상 멀티모달 모델의 지시 준수 능력 평가

Video-IFBench는 동영상을 정확히 이해하는지를 넘어 시각·음성·의미·형식·조건 분기를 포함한 복잡한 지시를 따르는지 평가한다. 20개가 넘는 최신 MLLM을 대상으로 한 평가에서 동영상 지시 준수의 어려움이 드러났다.

더 보기
CCTest · Blog
AnTrap이 드러낸 Android GUI 에이전트의 실행 중 취약성
모델 평가
cctest.ai
모델 평가

AnTrap이 드러낸 Android GUI 에이전트의 실행 중 취약성

AnTrap은 해결 가능한 Android 작업의 실행 과정에 현실적인 런타임 이상을 주입해 GUI 에이전트의 견고성을 평가한다. 실험 결과 대부분의 모델이 성능 저하를 보였으며, 학습으로 고칠 수 있는 오류와 더 깊은 추론 한계가 구분됐다.

더 보기
CCTest · Blog
구글 딥마인드, 모델과 시험 문제를 숨기는 이중 블라인드 AI 평가 시범 운영
모델 평가
cctest.ai
모델 평가

구글 딥마인드, 모델과 시험 문제를 숨기는 이중 블라인드 AI 평가 시범 운영

구글 딥마인드가 외부 기관들과 함께 모델 가중치와 평가 프롬프트를 서로 공개하지 않는 이중 블라인드 AI 평가를 시험한다. 기밀 컴퓨팅을 활용해 벤치마크 오염 위험을 줄이는 것이 목표다.

더 보기
CCTest · Blog
SWE Refactor Bench, 코딩 에이전트는 전체 저장소를 마이그레이션할 수 있을까
모델 평가
cctest.ai
모델 평가

SWE Refactor Bench, 코딩 에이전트는 전체 저장소를 마이그레이션할 수 있을까

새 벤치마크는 단일 버그 수정이 아니라 저장소 전체의 기술 스택 마이그레이션 능력을 평가한다. 520회 실행 중 마이그레이션 감사와 동작 테스트, 추가 검증을 모두 통과한 비율은 5.4%에 불과했다.

더 보기
CCTest · Blog
한 번의 성공은 신뢰성이 아니다: Thinkingbox로 업무 에이전트 평가하기
모델 평가
cctest.ai
모델 평가

한 번의 성공은 신뢰성이 아니다: Thinkingbox로 업무 에이전트 평가하기

Thinkingbox는 그럴듯한 답변이나 올바른 도구 호출을 넘어, 업무 흐름이 끝난 뒤 백엔드 상태가 요구사항과 일치하는지 검증합니다. 벤치마크 결과는 우연한 성공과 반복 가능한 실행 능력 사이에 큰 차이가 있음을 보여줍니다.

더 보기
CCTest · Blog
GameXpert-Bench: 게임 생성에서 실제 개발까지 평가하다
모델 평가
cctest.ai
모델 평가

GameXpert-Bench: 게임 생성에서 실제 개발까지 평가하다

GameXpert-Bench는 코딩 에이전트의 게임 개발 능력을 생성, 버그 수정, 다중 턴 최적화의 전체 과정에서 평가한다. 에이전트는 플레이 가능한 기반을 만드는 데는 강하지만, 능동적인 결함 발견과 런타임 검증, 회귀 방지에는 여전히 약점을 보인다.

더 보기
CCTest · Blog
MobilePA-Bench, 복잡한 실제 작업으로 모바일 에이전트를 검증하다
모델 평가
cctest.ai
모델 평가

MobilePA-Bench, 복잡한 실제 작업으로 모바일 에이전트를 검증하다

MobilePA-Bench는 단순한 화면 조작을 넘어 도구 호출, 장기 계획, 메모리, 복합 스킬, 서브에이전트 협업을 평가하는 인터랙티브 벤치마크입니다. 엄격한 도구 순서와 권한 제한, 실행 중 오류가 발생하면 최신 LLM의 신뢰성이 크게 떨어지는 것으로 나타났습니다.

더 보기
CCTest · Blog
LongRCA Bench, 장기 에이전트 실패의 책임자와 최초 원인을 찾다
모델 평가
cctest.ai
모델 평가

LongRCA Bench, 장기 에이전트 실패의 책임자와 최초 원인을 찾다

LongRCA Bench는 장기 실행 에이전트의 실패를 책임 역할 식별과 가장 이른 결정적 근본 원인 단계 탐지라는 두 과제로 나눠 평가한다. 1,140개의 실제 실패 궤적과 학습이 필요 없는 RCTA 방법을 함께 제시했다.

더 보기
CCTest · Blog
RAG 인덱스를 확장하면 답변이 달라지는 이유
모델 평가
cctest.ai
모델 평가

RAG 인덱스를 확장하면 답변이 달라지는 이유

모델과 프롬프트, 검색 정책을 그대로 유지해도 검색 인덱스를 확장하면 같은 질문에 대한 답변이 바뀔 수 있다는 연구 결과가 나왔다. 연구진은 일반적인 생성 변동성과 인덱스 업데이트의 영향을 분리하는 ‘스냅샷 호환성 감사’를 제안했다.

더 보기
CCTest · Blog
하이브리드 추론 MLLM은 정답을 넘어 응답 방식도 맞춰야 한다
모델 평가
cctest.ai
모델 평가

하이브리드 추론 MLLM은 정답을 넘어 응답 방식도 맞춰야 한다

새 연구는 하이브리드 추론 멀티모달 모델에서 사고 모드와 비사고 모드 사이에 뚜렷한 응답 행동 불일치가 나타난다고 분석했다. PatternEval과 PatternRL은 정확도만으로 포착하기 어려운 출력 실패를 측정하고 줄이기 위한 방법이다.

더 보기
CCTest · Blog
ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정
모델 평가
cctest.ai
모델 평가

ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정

Hume AI의 연구는 자동 음성 인식 모델이 공개 벤치마크의 정답 문구를 재현하는 경향을 측정하는 방법을 제시했다. 일부 고득점 오픈소스 모델은 음성이 모순되거나 가려졌거나 모호한 상황에서도 참조 문장을 그대로 출력했다.

더 보기
CCTest · Blog
NARU, 일본어 초장편 영상의 서사와 문화 이해를 평가하다
모델 평가
cctest.ai
모델 평가

NARU, 일본어 초장편 영상의 서사와 문화 이해를 평가하다

NARU는 일본어 장편 영상에서 변화하는 서사를 추적하고 명시되지 않은 문화적 의미를 추론하는 능력을 함께 평가하는 벤치마크다. 평가 결과, 현행 멀티모달 모델은 장거리 정보 통합과 문화적 맥락 기반 추론에서 여전히 큰 어려움을 보였다.

더 보기
CCTest · Blog
QuoteBench가 보여준 코딩 에이전트 명령 경로의 숨은 실패
모델 평가
cctest.ai
모델 평가

QuoteBench가 보여준 코딩 에이전트 명령 경로의 숨은 실패

코딩 에이전트의 성공 여부는 모델이 어떤 명령을 생성했는지뿐 아니라, 실행 전에 그 명령이 어떻게 직렬화되고 포장되며 다시 파싱되는지에도 좌우됩니다. QuoteBench는 단일 매칭 점수가 인터페이스에서 발생한 실패를 가릴 수 있음을 측정했습니다.

더 보기