아티클 & 가이드

모델 평가

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 78개의 아티클

CCTest · Blog
StealthBench: 자율 보안 에이전트의 ‘은밀한 수행 능력’을 평가하다
모델 평가
cctest.ai
모델 평가

StealthBench: 자율 보안 에이전트의 ‘은밀한 수행 능력’을 평가하다

StealthBench는 자율 offensive-security agents를 단순히 취약점을 찾는 능력이 아니라, 노출과 피해를 줄이며 임무를 수행하는 능력으로 평가한다. 논문 결과는 현재 모델들이 OPSEC 측면에서 아직 안정적이지 않음을 보여준다.

더 보기
CCTest · Blog
SecRespond: 침해 이후 대응 능력으로 AI 에이전트를 평가하다
모델 평가
cctest.ai
모델 평가

SecRespond: 침해 이후 대응 능력으로 AI 에이전트를 평가하다

SecRespond는 침해된 호스트의 포렌식 디스크 스냅샷과 보안 제품 증거를 바탕으로 AI 에이전트의 사고 대응 능력을 평가하는 벤치마크입니다. 연구 결과, 현재 모델은 명시적 경고는 비교적 잘 따라가지만 조용한 침입 탐지와 완전한 복구 계획에는 한계를 보였습니다.

더 보기
CCTest · Blog
AI 에이전트는 개방형 AI 연구를 수행할 수 있을까? 두 건의 섀도 평가가 준 초기 증거
모델 평가
cctest.ai
모델 평가

AI 에이전트는 개방형 AI 연구를 수행할 수 있을까? 두 건의 섀도 평가가 준 초기 증거

새 논문은 미발표 고품질 논문의 핵심 연구 질문을 AI 에이전트에 맡기고 원저자가 평가하는 ‘섀도 평가’를 제안했다. 결과는 현재 에이전트가 엔지니어링은 해내지만, 개방형 연구의 핵심 판단에는 여전히 취약하다는 점을 보여준다.

더 보기
CCTest · Blog
SceneActBench: VLM 에이전트는 본 3D 장면에서 실제로 행동할 수 있을까
모델 평가
cctest.ai
모델 평가

SceneActBench: VLM 에이전트는 본 3D 장면에서 실제로 행동할 수 있을까

SceneActBench는 3D 장면을 설명하는 능력이 아니라, 그 장면 안에서 올바른 행동 결과를 만들어내는 능력을 평가한다. 이미지나 비디오 프레임을 기반으로 VLM 에이전트의 공간 이해와 3D 행동 능력을 기하학적 지표로 측정한다.

더 보기
CCTest · Blog
LLM은 왜 변하는 사용자 의도를 놓치는가
모델 평가
cctest.ai
모델 평가

LLM은 왜 변하는 사용자 의도를 놓치는가

새 논문은 단일 턴 벤치마크에서 강한 성능을 보이는 LLM이라도 실제 대화에서 계속 바뀌는 사용자 의도를 안정적으로 추적하지 못할 수 있다고 지적한다. 연구진은 기존 정적 과제를 동적 다중 턴 대화로 바꾸는 평가 프레임워크를 제안했다.

더 보기
CCTest · Blog
공간 추론은 말보다 그림으로: ProVisE의 평가 방식
모델 평가
cctest.ai
모델 평가

공간 추론은 말보다 그림으로: ProVisE의 평가 방식

ProVisE는 공간 과제가 항상 텍스트나 좌표로 답하기 적합하지 않다는 문제에서 출발한다. 이미지 생성 모델이 픽셀 위에 표시하거나 경로를 그리도록 하고, 이를 기존 벤치마크가 채점할 수 있는 구조화된 예측으로 변환한다.

더 보기
CCTest · Blog
Tencent WorkBuddy Bench, 코딩 에이전트를 실제 업무 관점에서 평가하다
모델 평가
cctest.ai
모델 평가

Tencent WorkBuddy Bench, 코딩 에이전트를 실제 업무 관점에서 평가하다

Tencent WorkBuddy Bench는 코드, 웹, 오피스, 보안 영역에서 코딩 에이전트의 업무 수행 능력을 평가하는 벤치마크다. 공개 재현성을 유지하면서도 오염에 강한 태스크 구성 방식을 내세운 점이 핵심이다.

더 보기
CCTest · Blog
Stripe AI 에이전트 벤치마크가 드러낸 한계: 코드는 쓰지만 검증은 약하다
모델 평가
cctest.ai
모델 평가

Stripe AI 에이전트 벤치마크가 드러낸 한계: 코드는 쓰지만 검증은 약하다

Stripe가 실제 결제 통합 환경에 가까운 AI 에이전트 벤치마크를 공개했다. 결과는 에이전트가 코드 작성과 일부 백엔드 통합에서는 진전했지만, 엔드투엔드 검증과 상태 관리, 오류 복구에서는 여전히 취약하다는 점을 보여준다.

더 보기
CCTest · Blog
기업 AI Agent의 평가 격차: 문제는 테스트 수가 아니라 현실 정합성
모델 평가
cctest.ai
모델 평가

기업 AI Agent의 평가 격차: 문제는 테스트 수가 아니라 현실 정합성

VentureBeat Pulse Research가 157개 기업을 조사한 결과, 기업들은 AI Agent에 더 많은 자율성을 부여하면서도 이를 통제할 평가 체계는 충분히 신뢰하지 못하는 것으로 나타났다. 핵심은 평가 범위보다 실제 고객 환경과의 불일치다.

더 보기
CCTest · Blog
비디오 LLM은 정말 보고 있을까? VDG가 드러낸 정확도와 시각 이해의 분리
모델 평가
cctest.ai
모델 평가

비디오 LLM은 정말 보고 있을까? VDG가 드러낸 정확도와 시각 이해의 분리

ACM MM 2026에 채택된 한 논문은 비디오 LLM의 벤치마크 정확도가 곧 시각 이해를 뜻하지는 않는다고 지적한다. 연구진은 원본 비디오와 검은 화면 입력의 정답 차이를 측정하는 Visual Dependency Gap, 즉 VDG를 제안했다.

더 보기