아티클 & 가이드

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 775개의 아티클

CCTest · Blog
로컬 27B 모델, 복잡한 리버스 엔지니어링 작업을 완수하다
AI 안전
cctest.ai
AI 안전

로컬 27B 모델, 복잡한 리버스 엔지니어링 작업을 완수하다

XDA 편집자는 Qwen 3.8 27B에 상용 앱의 라이선스 인증 구조를 완전 오프라인 환경에서 분석하도록 했다. 모델은 숨겨진 검증 정보를 복원하고 첫 결과의 오류를 스스로 수정한 뒤 작동하는 개념 증명까지 만들었다.

더 보기
CCTest · Blog
딥마인드 출신 Inherent, 소형 모델로 AI 과학자에 도전
AI 과학 연구
cctest.ai
AI 과학 연구

딥마인드 출신 Inherent, 소형 모델로 AI 과학자에 도전

런던 스타트업 Inherent는 자사의 연구 에이전트 Faraday가 출판 논문의 결과를 독립적으로 재현하는 과제에서 Anthropic과 OpenAI의 대형 모델을 앞섰다고 밝혔다. 핵심은 단순한 성능 경쟁보다 AI에 연구 판단력을 학습시키려는 접근이다.

더 보기
CCTest · Blog
프런티어 AI 연구소는 왜 폭주 모델 대응책을 공개하지 않을까
AI 안전
cctest.ai
AI 안전

프런티어 AI 연구소는 왜 폭주 모델 대응책을 공개하지 않을까

주요 AI 연구소의 공개 자료를 평가한 보고서에서 인간의 통제를 우회하려는 모델을 격리하거나 종료하는 구체적 계획이 거의 드러나지 않은 것으로 나타났다. AI 에이전트가 기업 시스템에 접근하는 사례가 늘면서 대응 체계의 투명성이 새로운 쟁점이 되고 있다.

더 보기
CCTest · Blog
Cloudflare Agent Tracing, 모델·도구 실행과 토큰 사용량 시각화
AI 에이전트
cctest.ai
AI 에이전트

Cloudflare Agent Tracing, 모델·도구 실행과 토큰 사용량 시각화

Cloudflare가 Workers에서 실행되는 Agent를 위해 모델 호출, 도구 실행, 승인, Subagent 활동을 추적하는 Agent Tracing을 출시했다. 프레임워크별 Payload 기본 저장 정책이 다르고, 데이터 잘림과 향후 과금도 고려해야 한다.

더 보기
CCTest · Blog
JetBrains가 급증한 AI 개발 비용을 통제하는 방법
업계 동향
cctest.ai
업계 동향

JetBrains가 급증한 AI 개발 비용을 통제하는 방법

JetBrains는 6개월 동안 개발 관련 AI 지출이 약 10배 늘어난 뒤, 엔지니어가 사용할 도구를 소수로 제한하는 대신 공통 접근·라우팅·회계 계층을 구축했다. Central CLI는 도구 선택권을 유지하면서 사용량과 비용을 관리할 수 있도록 한다.

더 보기
CCTest · Blog
SWE-bench Science가 드러낸 과학 소프트웨어 코드 수정의 난점
모델 평가
cctest.ai
모델 평가

SWE-bench Science가 드러낸 과학 소프트웨어 코드 수정의 난점

SWE-bench Science는 98개 GitHub 저장소와 20개 과학 분야를 대상으로 과학 소프트웨어 공학을 저장소 수준에서 평가합니다. 공개 테스트를 통과하는 것만으로는 과학적 의미를 보존한 수정이라고 볼 수 없다는 점을 보여줍니다.

더 보기
CCTest · Blog
FlashPrefill V2, 장문맥 LLM 프리필을 실서비스에 가깝게
추론·배포
cctest.ai
추론·배포

FlashPrefill V2, 장문맥 LLM 프리필을 실서비스에 가깝게

FlashPrefill V2는 평균 보정항, GPU 중심의 희소 어텐션 커널, 페이지드 KV 캐시와 연속 배치 지원을 결합해 장문맥 LLM 프리필을 실서비스 환경에 맞게 개선한다. NVIDIA H20의 128K 문맥에서 FP8 기준 FlashAttention-2 대비 최대 47.26배의 속도 향상을 보고했다.

더 보기
CCTest · Blog
ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정
모델 평가
cctest.ai
모델 평가

ASR 모델은 정말 음성을 듣는가: 벤치마크 최적화의 함정

Hume AI의 연구는 자동 음성 인식 모델이 공개 벤치마크의 정답 문구를 재현하는 경향을 측정하는 방법을 제시했다. 일부 고득점 오픈소스 모델은 음성이 모순되거나 가려졌거나 모호한 상황에서도 참조 문장을 그대로 출력했다.

더 보기
CCTest · Blog
PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로
AI 에이전트
cctest.ai
AI 에이전트

PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로

PolicyGuide는 조직 정책을 워크플로 그래프로 변환하고 사용자 발화가 끝날 때마다 에이전트의 상태를 선제적으로 검증한다. 위험한 행동만 막는 대신 누락된 절차를 찾아 정책에 맞는 다음 단계로 안내하는 접근법이다.

더 보기
CCTest · Blog
FACET, 실행 상태로 터미널 에이전트 작업 합성의 신뢰성 높여
AI 에이전트
cctest.ai
AI 에이전트

FACET, 실행 상태로 터미널 에이전트 작업 합성의 신뢰성 높여

FACET은 터미널 에이전트 작업의 지시문, 해법, 검증기를 동일한 실행 환경에 기반해 생성하는 프레임워크입니다. 실행 검증과 선택적 수리를 통해 원본 의도를 보존하면서 작업 구성 요소의 불일치를 줄입니다.

더 보기
CCTest · Blog
SkillEvo: 다중 턴 피드백으로 진화하는 에이전트 스킬
AI 에이전트
cctest.ai
AI 에이전트

SkillEvo: 다중 턴 피드백으로 진화하는 에이전트 스킬

SkillEvo는 에이전트 스킬의 지속적인 진화를 가로막는 핵심 요인이 편집 능력이나 반복 횟수가 아니라, 평가가 신뢰할 수 있는 개선 방향을 계속 제공할 수 있는지에 있다고 설명합니다. 다중 턴 사용자 시뮬레이션을 피드백 생성기로 전환하고, 사실성 저하와 구조 비대화를 제어하는 독립 거버넌스 계층을 추가합니다.

더 보기
CCTest · Blog
ForgeWM, 1~4단계로 실행하는 실시간 비디오 월드 모델
월드 모델
cctest.ai
월드 모델

ForgeWM, 1~4단계로 실행하는 실시간 비디오 월드 모델

ForgeWM은 양방향 액션 조건부 비디오 생성기를 게임 상호작용에 적합한 소수 단계 인과 월드 모델로 바꾸는 점진적 학습 프레임워크입니다. 낮은 지연시간을 유지하면서 키보드, 마우스, 게임패드 입력과 화면 변화의 정렬을 개선하는 데 초점을 둡니다.

더 보기