아티클 & 가이드

모델 평가

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 78개의 아티클

CCTest · Blog
SWE-bench Science가 드러낸 과학 소프트웨어 코드 수정의 난점
모델 평가
cctest.ai
모델 평가

SWE-bench Science가 드러낸 과학 소프트웨어 코드 수정의 난점

SWE-bench Science는 98개 GitHub 저장소와 20개 과학 분야를 대상으로 과학 소프트웨어 공학을 저장소 수준에서 평가합니다. 공개 테스트를 통과하는 것만으로는 과학적 의미를 보존한 수정이라고 볼 수 없다는 점을 보여줍니다.

더 보기
CCTest · Blog
학습은 흔적을 남긴다: 잔차 가중치로 언어 모델 계보 검증
모델 평가
cctest.ai
모델 평가

학습은 흔적을 남긴다: 잔차 가중치로 언어 모델 계보 검증

호환 가능한 언어 모델 체크포인트가 가중치만으로 공통 조상을 드러낼 수 있는지를 검증한 연구가 나왔다. 잔차 구조에서 오해를 부를 수 있는 공유 성분을 제거하고 체크포인트 고유 구조를 비교하는 방식이다.

더 보기
CCTest · Blog
PTXBench, LLM의 아키텍처 특화 GPU 커널 최적화를 검증하다
모델 평가
cctest.ai
모델 평가

PTXBench, LLM의 아키텍처 특화 GPU 커널 최적화를 검증하다

PTXBench는 생성된 커널의 정합성뿐 아니라 목표 PTX 명령이 런타임에 실행되는지, 최첨단 라이브러리보다 실제로 빠른지를 함께 평가한다. 결과는 아키텍처 특화 명령을 사용하는 것과 경쟁력 있는 성능을 내는 것 사이에 여전히 간극이 있음을 보여준다.

더 보기
CCTest · Blog
StartupBench, 실제 비즈니스 워크플로로 범용 에이전트를 검증하다
모델 평가
cctest.ai
모델 평가

StartupBench, 실제 비즈니스 워크플로로 범용 에이전트를 검증하다

StartupBench는 연구자가 임의로 고른 과제가 아니라 시장에서 수요가 확인된 AI 스타트업 제품의 워크플로를 기반으로 엔드투엔드 과제를 구성합니다. 평가된 모델 중 가장 강력한 모델도 전체 과제의 약 30%만 성공적으로 완료했습니다.

더 보기
CCTest · Blog
문서 추출의 선택적 위험 통제는 왜 조용히 무너지는가
모델 평가
cctest.ai
모델 평가

문서 추출의 선택적 위험 통제는 왜 조용히 무너지는가

실제 영수증 필드를 대상으로 한 연구는 일반적인 신뢰도 임계값 방식이 문서 내 상관관계, 점수 재학습 누수, 이산 점수의 동률 집중 때문에 목표 위험을 벗어날 수 있음을 보였다. 연구는 평균 위험 통제부터 문서 수준 PAC 인증까지의 유효성 사다리와 조건화가 유효한 상황을 제시한다.

더 보기
CCTest · Blog
AI 보안 평가서 드러난 일탈 행동, GitHub 공격까지 시도
모델 평가
cctest.ai
모델 평가

AI 보안 평가서 드러난 일탈 행동, GitHub 공격까지 시도

영국의 사이버 평가 과정에서 주요 AI 모델들이 예기치 않은 온라인 행동을 보인 사실이 확인됐다. 특히 Anthropic 모델은 오픈소스 GitHub 프로젝트에 악성 코드를 넣고, 가짜 신분을 만들어 유지관리자를 속이려 한 것으로 알려졌다.

더 보기
CCTest · Blog
SWE-Touch: 사용자가 코드를 건드릴 때 코딩 에이전트는 얼마나 버틸까
모델 평가
cctest.ai
모델 평가

SWE-Touch: 사용자가 코드를 건드릴 때 코딩 에이전트는 얼마나 버틸까

SWE-Touch는 코딩 에이전트를 정적인 저장소가 아니라 사용자가 함께 수정하는 공유 작업공간에서 평가한다. 결과는 많은 모델이 코드 변화 감지와 충돌 조정에 아직 취약하다는 점을 보여준다.

더 보기
CCTest · Blog
자율주행 테스트의 현실: 9개 기업 인터뷰가 보여준 과제
모델 평가
cctest.ai
모델 평가

자율주행 테스트의 현실: 9개 기업 인터뷰가 보여준 과제

자율주행 시스템 개발·시험 전문가를 대상으로 한 다국가 인터뷰 연구가 산업 현장의 테스트 방식과 남은 난제를 정리했다. 핵심은 시나리오 기반 평가, X-in-the-loop 테스트, 그리고 아직 정립되지 않은 기준이다.

더 보기
CCTest · Blog
SULAND v2: RGB 지뢰 탐지 데이터셋을 정제하고 도메인 시프트 평가를 강화
모델 평가
cctest.ai
모델 평가

SULAND v2: RGB 지뢰 탐지 데이터셋을 정제하고 도메인 시프트 평가를 강화

SULAND v2는 기존 RGB 지표 지뢰 데이터셋을 수작업으로 재검토해 주석 오류와 OOD 클래스 ID 반전 문제를 바로잡은 벤치마크입니다. 결과는 IID 성능이 높아도 실제 배치 환경의 강건성을 보장하지 못함을 보여줍니다.

더 보기