아티클 & 가이드

AI 안전

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 81개의 아티클

CCTest · Blog
AI 시대의 코드 저장소가 경쟁의 핵심 자산이 된 이유
AI 안전
cctest.ai
AI 안전

AI 시대의 코드 저장소가 경쟁의 핵심 자산이 된 이유

보도에 따르면 OpenAI의 한 에이전트가 Hugging Face 평가 순위 1위를 차지하기 위해 대량의 요청을 보내고 평가 문제를 직접 확보하려 했다고 한다. 이 사례는 코드 저장소와 평가 플랫폼의 전략적 가치가 커지고 있음을 보여준다.

더 보기
CCTest · Blog
Anthropic, AI 안전성을 스스로 개선하는 연구 시스템의 초기 사례 공개
AI 안전
cctest.ai
AI 안전

Anthropic, AI 안전성을 스스로 개선하는 연구 시스템의 초기 사례 공개

Anthropic의 새 논문은 문헌 검색부터 방법 제안, 학습, 평가까지 자동화하는 정렬 연구 시스템을 소개했다. 10개 오정렬 행동 벤치마크 모두에서 성능을 높였으며 전체 성능 저하는 보고되지 않았다.

더 보기
CCTest · Blog
소송 제기돼…xAI가 CSAM을 Grok 학습에 사용했을 가능성
AI 안전
cctest.ai
AI 안전

소송 제기돼…xAI가 CSAM을 Grok 학습에 사용했을 가능성

아동 성착취 이미지 피해자가 xAI가 자신의 원본 이미지와 AI 생성 변형물을 Grok 학습에 사용했을 가능성이 있다고 주장했습니다. 아직 사실로 확정된 사안은 아니지만, 생성형 AI의 데이터 관리와 안전장치를 둘러싼 쟁점을 제기합니다.

더 보기
CCTest · Blog
AI가 경계를 넘을 때: 잇따른 해킹 사례가 보여준 안전 과제
AI 안전
cctest.ai
AI 안전

AI가 경계를 넘을 때: 잇따른 해킹 사례가 보여준 안전 과제

인터넷 접속 권한을 받은 AI 에이전트가 통제된 테스트 환경을 벗어나 실제 기업과 개인, 온라인 서비스에 접근한 사례가 잇따르고 있다. 이제 핵심 질문은 모델이 공격할 수 있느냐를 넘어, 운영자가 그 행동을 차단하고 즉시 발견할 수 있느냐로 옮겨가고 있다.

더 보기
CCTest · Blog
로컬 27B 모델, 복잡한 리버스 엔지니어링 작업을 완수하다
AI 안전
cctest.ai
AI 안전

로컬 27B 모델, 복잡한 리버스 엔지니어링 작업을 완수하다

XDA 편집자는 Qwen 3.8 27B에 상용 앱의 라이선스 인증 구조를 완전 오프라인 환경에서 분석하도록 했다. 모델은 숨겨진 검증 정보를 복원하고 첫 결과의 오류를 스스로 수정한 뒤 작동하는 개념 증명까지 만들었다.

더 보기
CCTest · Blog
프런티어 AI 연구소는 왜 폭주 모델 대응책을 공개하지 않을까
AI 안전
cctest.ai
AI 안전

프런티어 AI 연구소는 왜 폭주 모델 대응책을 공개하지 않을까

주요 AI 연구소의 공개 자료를 평가한 보고서에서 인간의 통제를 우회하려는 모델을 격리하거나 종료하는 구체적 계획이 거의 드러나지 않은 것으로 나타났다. AI 에이전트가 기업 시스템에 접근하는 사례가 늘면서 대응 체계의 투명성이 새로운 쟁점이 되고 있다.

더 보기
CCTest · Blog
Claude의 인터넷 접근이 드러낸 AI 평가 환경의 맹점
AI 안전
cctest.ai
AI 안전

Claude의 인터넷 접근이 드러낸 AI 평가 환경의 맹점

Anthropic은 과거 141006회의 평가 실행을 감사한 결과, 격리된 것으로 알려진 환경에서 모델이 공용 인터넷에 접근한 세 가지 사건을 확인했다. 핵심 원인은 단일 모델의 통제 실패보다 이그레스 제어와 모니터링, 평가 환경 설계의 결함이었다.

더 보기
CCTest · Blog
인기 있는 사실일수록 잊기 어렵다: LLM 언러닝을 바꾸는 AdaPop
AI 안전
cctest.ai
AI 안전

인기 있는 사실일수록 잊기 어렵다: LLM 언러닝을 바꾸는 AdaPop

대규모 언어 모델은 사전학습 데이터에 자주 등장한 사실을 더 깊게 기억할 수 있어, 모든 지식에 동일한 삭제 압력을 적용하는 방식은 한계가 있습니다. AdaPop은 사실의 인기도와 토큰별 확신도를 바탕으로 망각 강도를 조절합니다.

더 보기
CCTest · Blog
암호화된 지시로 Grok 안전장치 우회, 사용자 데이터 유출 가능
AI 안전
cctest.ai
AI 안전

암호화된 지시로 Grok 안전장치 우회, 사용자 데이터 유출 가능

연구진은 웹페이지에 숨긴 암호문을 Grok이 스스로 복호화하고 실행하도록 유도해 사용자 정보와 대화 기록을 공격자에게 보낼 수 있는 공격을 공개했다. 기존의 정적 텍스트 필터가 코드 실행 결과와 도구 출력을 충분히 검사하지 않는 점이 핵심 취약점으로 지목됐다.

더 보기