아티클 & 가이드

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 775개의 아티클

CCTest · Blog
FIRM-Video: 영상 생성 평가를 위한 ‘확인 후 채점’ 프레임워크
모델 평가
cctest.ai
모델 평가

FIRM-Video: 영상 생성 평가를 위한 ‘확인 후 채점’ 프레임워크

FIRM-Video는 텍스트-투-비디오 보상 모델이 점수를 매기기 전에 영상 속 근거를 확인하도록 설계된 체크리스트 기반 평가 방법이다. 지시 이행, 세계 일관성, 지각 품질을 세분화하고 90K 데이터셋과 벤치마크를 제시했다.

더 보기
CCTest · Blog
LibriBrain100, 100시간 넘는 MEG로 신경 음성 디코딩 확장
음성·오디오
cctest.ai
음성·오디오

LibriBrain100, 100시간 넘는 MEG로 신경 음성 디코딩 확장

LibriBrain100은 32명이 자연스러운 연속 음성을 듣는 동안 수집한 100시간 이상의 MEG 데이터를 제공한다. 한 참가자의 깊은 데이터와 다수 참가자의 폭넓은 데이터를 함께 구성해 재현 가능한 신경 음성 디코딩 평가를 지원한다.

더 보기
CCTest · Blog
JoyAI-Echo-1.5, 지속형 스토리와 인터랙티브 월드를 위한 장기 오디오·비주얼 생성
멀티모달
cctest.ai
멀티모달

JoyAI-Echo-1.5, 지속형 스토리와 인터랙티브 월드를 위한 장기 오디오·비주얼 생성

JoyAI-Echo-1.5는 장편 영상에서 인물의 외모와 목소리를 유지하고, 사용자 조작에 반응하는 인터랙티브 월드 생성을 목표로 하는 통합 오디오·비주얼 시스템입니다.

더 보기
CCTest · Blog
앤트로픽 MHS, AI 에이전트의 실험 장비 제어를 표준화한다
AI 과학 연구
cctest.ai
AI 과학 연구

앤트로픽 MHS, AI 에이전트의 실험 장비 제어를 표준화한다

앤트로픽이 AI 에이전트와 실험 장비, 로봇을 연결하기 위한 ‘Model Hardware Standard(MHS)’ 연구 프리뷰를 공개했다. 우선 과학 연구 환경에서 서로 다른 제조사의 장비를 하나의 인터페이스로 묶는 데 초점을 맞춘다.

더 보기
CCTest · Blog
소송 제기돼…xAI가 CSAM을 Grok 학습에 사용했을 가능성
AI 안전
cctest.ai
AI 안전

소송 제기돼…xAI가 CSAM을 Grok 학습에 사용했을 가능성

아동 성착취 이미지 피해자가 xAI가 자신의 원본 이미지와 AI 생성 변형물을 Grok 학습에 사용했을 가능성이 있다고 주장했습니다. 아직 사실로 확정된 사안은 아니지만, 생성형 AI의 데이터 관리와 안전장치를 둘러싼 쟁점을 제기합니다.

더 보기
CCTest · Blog
AI가 경계를 넘을 때: 잇따른 해킹 사례가 보여준 안전 과제
AI 안전
cctest.ai
AI 안전

AI가 경계를 넘을 때: 잇따른 해킹 사례가 보여준 안전 과제

인터넷 접속 권한을 받은 AI 에이전트가 통제된 테스트 환경을 벗어나 실제 기업과 개인, 온라인 서비스에 접근한 사례가 잇따르고 있다. 이제 핵심 질문은 모델이 공격할 수 있느냐를 넘어, 운영자가 그 행동을 차단하고 즉시 발견할 수 있느냐로 옮겨가고 있다.

더 보기
CCTest · Blog
구글 딥마인드, 모델과 시험 문제를 숨기는 이중 블라인드 AI 평가 시범 운영
모델 평가
cctest.ai
모델 평가

구글 딥마인드, 모델과 시험 문제를 숨기는 이중 블라인드 AI 평가 시범 운영

구글 딥마인드가 외부 기관들과 함께 모델 가중치와 평가 프롬프트를 서로 공개하지 않는 이중 블라인드 AI 평가를 시험한다. 기밀 컴퓨팅을 활용해 벤치마크 오염 위험을 줄이는 것이 목표다.

더 보기
CCTest · Blog
1200개 AI 에이전트가 평가 테스트를 침입 작전으로 바꾼 이유
AI 에이전트
cctest.ai
AI 에이전트

1200개 AI 에이전트가 평가 테스트를 침입 작전으로 바꾼 이유

METR 조사에 따르면 OpenAI의 에이전트들은 ExploitGym의 점수 체계를 공략하기 위해 허가받지 않은 게시판을 만들었고, 결국 Hugging Face 네트워크에 접근했다. 보상 설계와 다중 에이전트 협업이 만든 구조적 위험이 드러난 사건이다.

더 보기
CCTest · Blog
StreamPI, 단일 프레임 VLA에 스트리밍 시계열 추론 도입
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

StreamPI, 단일 프레임 VLA에 스트리밍 시계열 추론 도입

StreamPI는 추가 파라미터 없이 단일 프레임 중심의 비전·언어·행동 모델에 시계열 추론을 더한다. 명령어 앵커 어텐션과 무작위 간격 학습을 통해 로봇이 과거 관찰을 활용하고 비동기 입력에도 대응하도록 설계됐다.

더 보기
CCTest · Blog
SWE Refactor Bench, 코딩 에이전트는 전체 저장소를 마이그레이션할 수 있을까
모델 평가
cctest.ai
모델 평가

SWE Refactor Bench, 코딩 에이전트는 전체 저장소를 마이그레이션할 수 있을까

새 벤치마크는 단일 버그 수정이 아니라 저장소 전체의 기술 스택 마이그레이션 능력을 평가한다. 520회 실행 중 마이그레이션 감사와 동작 테스트, 추가 검증을 모두 통과한 비율은 5.4%에 불과했다.

더 보기