아티클 & 가이드

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 775개의 아티클

CCTest · Blog
Anthropic, AI 안전성을 스스로 개선하는 연구 시스템의 초기 사례 공개
AI 안전
cctest.ai
AI 안전

Anthropic, AI 안전성을 스스로 개선하는 연구 시스템의 초기 사례 공개

Anthropic의 새 논문은 문헌 검색부터 방법 제안, 학습, 평가까지 자동화하는 정렬 연구 시스템을 소개했다. 10개 오정렬 행동 벤치마크 모두에서 성능을 높였으며 전체 성능 저하는 보고되지 않았다.

더 보기
CCTest · Blog
오픈 웨이트 AI 기업이 실리콘밸리의 인수 표적이 된 이유
오픈소스
cctest.ai
오픈소스

오픈 웨이트 AI 기업이 실리콘밸리의 인수 표적이 된 이유

Hugging Face, Poolside, OpenRouter를 둘러싼 대형 거래 보도는 오픈 웨이트 AI가 단순한 모델 공유를 넘어 핵심 인프라 사업으로 변하고 있음을 보여준다. 반도체 기업과 소프트웨어 플랫폼은 개발자와 추론의 관문을 확보하기 위해 경쟁하고 있다.

더 보기
CCTest · Blog
미 연방법원, 트럼프 행정부의 앤트로픽 블랙리스트 지정은 불법
정책·규제
cctest.ai
정책·규제

미 연방법원, 트럼프 행정부의 앤트로픽 블랙리스트 지정은 불법

앤트로픽이 치명적 자율무기와 미국인 대량 감시에 대한 사용 제한을 완화하지 않자 트럼프 행정부가 취한 전면 거래 중단 조치를 연방법원이 위법한 보복으로 판단했다. 법원은 앤트로픽의 국가안보 공급망 위험 지정과 관련 정부 지침을 취소했다.

더 보기
CCTest · Blog
미 EPA, 데이터센터 대기오염에 대한 주민 감시 약화 추진
정책·규제
cctest.ai
정책·규제

미 EPA, 데이터센터 대기오염에 대한 주민 감시 약화 추진

미 환경보호청(EPA)이 일부 ‘소규모’ 오염원에 대한 연방 차원의 공고와 의견 수렴 의무를 없애는 규칙 변경을 제안했다. 환경단체들은 데이터센터와 관련 전력 시설이 지역 주민의 충분한 검토 없이 추진될 수 있다고 우려한다.

더 보기
CCTest · Blog
LinkedIn이 멀티 에이전트로 AI 코드 리뷰를 확장한 방법
코딩 AI
cctest.ai
코딩 AI

LinkedIn이 멀티 에이전트로 AI 코드 리뷰를 확장한 방법

LinkedIn은 기존 AI 리뷰 도구를 저장소 앞에 그대로 붙이는 대신, 여러 리뷰 에이전트와 조직 고유의 규칙을 결합한 플랫폼을 구축했다. 핵심은 댓글 수가 아니라 환각과 저가치 피드백을 줄이고 개발자가 실제로 채택할 만한 신호를 제공하는 데 있다.

더 보기
CCTest · Blog
Cloudflare, AI 에이전트용 경량 브라우저 엔진 Kitesurf 공개
AI 에이전트
cctest.ai
AI 에이전트

Cloudflare, AI 에이전트용 경량 브라우저 엔진 Kitesurf 공개

Cloudflare가 HTML 추출, 스크린샷, PDF 생성 같은 자동화 작업을 겨냥한 실험적 브라우저 엔진 Kitesurf를 공개했다. 아직 Chromium을 대체할 수는 없지만, 사람보다 소프트웨어 에이전트에 맞춘 브라우저 인프라의 가능성을 보여준다.

더 보기
CCTest · Blog
게임 개발은 월드 모델을 위한 검증 가능한 데이터 엔진이 될 수 있을까
월드 모델
cctest.ai
월드 모델

게임 개발은 월드 모델을 위한 검증 가능한 데이터 엔진이 될 수 있을까

새 논문은 월드 모델의 확장이 더 많은 웹 비디오와 연산량만으로 해결되지 않으며, 근거 있는 보상 신호를 반복적으로 만들어내는 데이터 엔진이 필요하다고 주장합니다. 게임 엔진은 공간 모델의 강화학습 후학습에 실행 가능한 환경과 장기 궤적을 제공할 수 있습니다.

더 보기
CCTest · Blog
Claude가 물리 세계로 간다: Anthropic, MHS 하드웨어 표준 공개
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

Claude가 물리 세계로 간다: Anthropic, MHS 하드웨어 표준 공개

Anthropic이 AI 에이전트가 로봇 팔, 현미경, 카메라, 실험 장비를 발견하고 제어할 수 있도록 설계한 ‘모델 하드웨어 표준(MHS)’ 연구 프리뷰를 공개했다. Claude에 하나의 고정된 몸을 부여하기보다, 연결된 장비를 필요에 따라 빌려 쓰는 접근이다.

더 보기
CCTest · Blog
고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개
비전·비디오
cctest.ai
비전·비디오

고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개

고덕이 최근 12개 프레임만을 국소 문맥으로 활용해 긴 영상의 3D 장면을 순차적으로 재구성하는 모델 ABot-Recon을 공개했다. 장기 메모리 의존을 없애 장거리 시퀀스에서 발생하는 오차 누적, 속도 저하, 메모리 증가 문제를 줄이는 것이 핵심이다.

더 보기
CCTest · Blog
JIT-Agent, 작업에 맞춰 에이전트 실행 프레임워크를 즉시 생성
AI 에이전트
cctest.ai
AI 에이전트

JIT-Agent, 작업에 맞춰 에이전트 실행 프레임워크를 즉시 생성

JIT-Agent는 에이전트의 메모리 관리, 계획, 행동 프로토콜, 도구 오케스트레이션을 생성 가능한 실행 프레임워크로 다룬다. 작업별 맞춤화와 함께 실행 오류 수정, 과거 설정을 활용한 지속적 진화도 목표로 한다.

더 보기
CCTest · Blog
Video-IFBench, 동영상 멀티모달 모델의 지시 준수 능력 평가
모델 평가
cctest.ai
모델 평가

Video-IFBench, 동영상 멀티모달 모델의 지시 준수 능력 평가

Video-IFBench는 동영상을 정확히 이해하는지를 넘어 시각·음성·의미·형식·조건 분기를 포함한 복잡한 지시를 따르는지 평가한다. 20개가 넘는 최신 MLLM을 대상으로 한 평가에서 동영상 지시 준수의 어려움이 드러났다.

더 보기
CCTest · Blog
AnTrap이 드러낸 Android GUI 에이전트의 실행 중 취약성
모델 평가
cctest.ai
모델 평가

AnTrap이 드러낸 Android GUI 에이전트의 실행 중 취약성

AnTrap은 해결 가능한 Android 작업의 실행 과정에 현실적인 런타임 이상을 주입해 GUI 에이전트의 견고성을 평가한다. 실험 결과 대부분의 모델이 성능 저하를 보였으며, 학습으로 고칠 수 있는 오류와 더 깊은 추론 한계가 구분됐다.

더 보기