아티클 & 가이드

모델 평가

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 98개의 아티클

CCTest · Blog
PerfReasoning, LLM은 하드웨어 성능을 제대로 추론할 수 있을까
모델 평가
cctest.ai
모델 평가

PerfReasoning, LLM은 하드웨어 성능을 제대로 추론할 수 있을까

PerfReasoning은 하드웨어 성능에 대한 직접 추론과 분석용 성능 모델 코드 생성을 পৃথ도로 평가하는 벤치마크다. 결과는 그럴듯한 설명을 만드는 능력과 신뢰할 수 있는 성능 모델을 구축하는 능력 사이에 큰 격차가 있음을 보여준다.

더 보기
CCTest · Blog
VeriPhy: 생성 영상의 물리적 신뢰성을 추적 가능하게 평가하다
모델 평가
cctest.ai
모델 평가

VeriPhy: 생성 영상의 물리적 신뢰성을 추적 가능하게 평가하다

매끄럽게 보이는 생성 영상도 객체 수, 공간 관계, 사건의 순서를 틀릴 수 있습니다. VeriPhy는 프롬프트를 타입이 지정된 물리적 의무로 변환하고, 판단의 근거까지 추적할 수 있는 평가 결과를 제공합니다.

더 보기
CCTest · Blog
음성 뇌-컴퓨터 인터페이스의 실질적 소통량을 측정하는 OVMI
모델 평가
cctest.ai
모델 평가

음성 뇌-컴퓨터 인터페이스의 실질적 소통량을 측정하는 OVMI

음성 뇌-컴퓨터 인터페이스는 데이터셋, 어휘, 평가 지표가 서로 달라 연구 결과를 직접 비교하기 어렵습니다. 새로운 개방형 어휘 상호정보량(OVMI)은 디코딩 정확도와 사용자의 언어를 얼마나 폭넓게 지원하는지를 함께 평가합니다.

더 보기
CCTest · Blog
Principia, 영상 모델이 물리 법칙을 이해하는지 관계성으로 검증
모델 평가
cctest.ai
모델 평가

Principia, 영상 모델이 물리 법칙을 이해하는지 관계성으로 검증

영상 생성 모델은 자연스러운 움직임을 만들 수 있지만 기본적인 물리 법칙을 지킨다는 뜻은 아닙니다. Principia는 같은 장면 속 물체들의 관계를 이용해 카메라 보정 없이 물리적 일관성을 평가합니다.

더 보기
CCTest · Blog
금융 AI 연례 시험, 모델 경쟁에서 실제 업무 시스템으로
모델 평가
cctest.ai
모델 평가

금융 AI 연례 시험, 모델 경쟁에서 실제 업무 시스템으로

AFAC2026에는 5,027개 팀과 약 2만 명이 참가해 시장 분석, 금융 문서, 자동화 실험, 장문 Agent 과제를 수행했습니다. 대회는 금융 AI의 평가 기준이 단일 정확도에서 실제 운영 능력으로 이동하고 있음을 보여줍니다.

더 보기
CCTest · Blog
ExecRetrieval이 드러낸 코드 검색의 ‘유사성’과 ‘정확성’의 간극
모델 평가
cctest.ai
모델 평가

ExecRetrieval이 드러낸 코드 검색의 ‘유사성’과 ‘정확성’의 간극

ExecRetrieval은 정답 구현과 거의 동일하게 보이지만 실행 결과가 틀린 코드 변형을 검색 후보에 함께 넣어, 코드 임베딩의 기능적 판별 능력을 측정한다. 정답을 상위권에서 찾는 것과 1위로 고르는 것 사이에는 큰 차이가 나타났다.

더 보기
CCTest · Blog
S³Gym: LLM은 자기 테스트와 자기 평가로 실제 개선할 수 있을까
모델 평가
cctest.ai
모델 평가

S³Gym: LLM은 자기 테스트와 자기 평가로 실제 개선할 수 있을까

S³Gym은 LLM 에이전트가 자신의 행동을 시험하고 경험을 판단한 뒤 이후 의사결정을 개선할 수 있는지 평가하는 대화형 벤치마크입니다. 연구 결과, 경험의 효과는 과제 구조와 저장 방식에 크게 좌우되는 것으로 나타났습니다.

더 보기
CCTest · Blog
에이전트의 실패는 무지일까 무능일까, 지식 게이트 평가 프로토콜
모델 평가
cctest.ai
모델 평가

에이전트의 실패는 무지일까 무능일까, 지식 게이트 평가 프로토콜

새 연구가 도메인 지식 부족과 실행 능력 부족을 구분하기 위한 지식 게이트형 작업 구성 프로토콜을 제안했다. 비공개 지식 아티팩트의 제공 여부를 엄격히 비교해 일부 작업에서 뚜렷한 의존성을 확인했지만, 후속 학습 효과까지 입증한 것은 아니다.

더 보기
CCTest · Blog
RealSWE: 실제 사용자 요청으로 다시 보는 코딩 에이전트 평가
모델 평가
cctest.ai
모델 평가

RealSWE: 실제 사용자 요청으로 다시 보는 코딩 에이전트 평가

SWE-bench의 문제는 대체로 정형화되고 정보가 풍부하지만, 실제 사용자의 요청은 짧고 구어체이며 맥락이 부족한 경우가 많습니다. RealSWE는 현실적인 입력이 평균 해결률을 낮추고 모델 순위까지 바꿀 수 있음을 보여줍니다.

더 보기
CCTest · Blog
1년간 쇼핑몰 운영으로 검증한 LLM 에이전트의 장기 자율성
모델 평가
cctest.ai
모델 평가

1년간 쇼핑몰 운영으로 검증한 LLM 에이전트의 장기 자율성

E-Commerce Bench는 LLM 에이전트가 365일 동안 조달 협상, 판매, 주문 처리, 반품, 현금흐름 관리를 수행하도록 설계된 평가 벤치마크입니다. 높은 수익과 종합적인 운영 역량은 서로 다를 수 있다는 결과를 보여줍니다.

더 보기
CCTest · Blog
AgentJudgeBench, 도구 호출 에이전트를 평가하는 LLM의 신뢰성 검증
모델 평가
cctest.ai
모델 평가

AgentJudgeBench, 도구 호출 에이전트를 평가하는 LLM의 신뢰성 검증

AgentJudgeBench는 개방형 텍스트 선호도가 아니라 의존 관계가 있는 도구 호출 워크플로에서 LLM 평가자를 시험한다. 결과는 평가 신뢰성이 모델 규모보다 작업 난도에 더 크게 좌우될 수 있음을 보여준다.

더 보기
CCTest · Blog
SpanCalib-VLM, 비전언어 모델 환각 구간을 더 신뢰성 있게 탐지
모델 평가
cctest.ai
모델 평가

SpanCalib-VLM, 비전언어 모델 환각 구간을 더 신뢰성 있게 탐지

SpanCalib-VLM은 생성형 비전언어 모델과 멀티모달 시퀀스 태거를 결합해 환각 텍스트 구간을 찾고 confidence를 재보정합니다. SHROOM-Visions 영어 평가 분할에서 구간 검출과 점수 신뢰도를 함께 다루는 방식을 제시했습니다.

더 보기
CCTest · Blog
추론 과정은 정말 충실한가: 도구를 통해 들어온 단서는 더 쉽게 감춰진다
모델 평가
cctest.ai
모델 평가

추론 과정은 정말 충실한가: 도구를 통해 들어온 단서는 더 쉽게 감춰진다

FACE-Eval 연구는 선호 단서가 어디에, 얼마나 명시적으로 전달되는지가 모델의 사고 과정 충실성에 큰 영향을 준다고 보고했다. 도구 반환값이나 원시 자료에 숨은 단서는 추론 텍스트에 드러나지 않은 채 답변에 반영될 가능성이 높았다.

더 보기
CCTest · Blog
본 것을 정확히 실행할 수 있을까: EASEL이 평가한 멀티모달 에이전트
모델 평가
cctest.ai
모델 평가

본 것을 정확히 실행할 수 있을까: EASEL이 평가한 멀티모달 에이전트

EASEL은 멀티모달 모델이 이미지를 이해하는 데서 그치지 않고, 시각적 피드백을 바탕으로 도구 사용을 계속 수정할 수 있는지 평가한다. 핵심 과제는 참조 이미지와 같아지도록 캔버스를 단계적으로 그리는 것이다.

더 보기
CCTest · Blog
LoopArena, 코딩 에이전트의 장기 제어 능력을 평가하다
모델 평가
cctest.ai
모델 평가

LoopArena, 코딩 에이전트의 장기 제어 능력을 평가하다

LoopArena는 코딩 에이전트를 움직이는 제어 루프를 분리해, 한 모델이 다른 고정 코딩 에이전트를 장기 소프트웨어 작업에서 얼마나 잘 이끌 수 있는지 측정합니다. 결과는 안정적인 장기 제어가 여전히 어려운 과제임을 보여줍니다.

더 보기
CCTest · Blog
GMA, 현실에 가까운 복잡한 작업으로 모바일 에이전트 평가
모델 평가
cctest.ai
모델 평가

GMA, 현실에 가까운 복잡한 작업으로 모바일 에이전트 평가

새로운 벤치마크 GMA는 오픈소스 프로젝트를 기반으로 한 7개 앱과 300개 과제를 통해 단일 조작부터 다단계 워크플로까지 모바일 에이전트를 평가한다. 과제가 복잡해질수록 성능이 크게 하락했지만, 컨텍스트 유지와 명시적 상태 추적을 포함한 하니스 설계는 일부 어려운 작업의 수행을 개선할 수 있었다.

더 보기
CCTest · Blog
평가 결과는 실제로 무엇을 입증할 수 있는가
모델 평가
cctest.ai
모델 평가

평가 결과는 실제로 무엇을 입증할 수 있는가

특정 커밋에 고정한 Inspect Evals 전수 조사에서, 실행 가능한 평가 코드만으로는 지표에 연결된 과거의 주장까지 재현할 수 없다는 점이 드러났다. 기계적으로 대상이 된 124개 유닛 중 110개는 필요한 증거 또는 의미적 근거가 없어 결정적 추론에 들어가기 전에 중단됐다.

더 보기