아티클 & 가이드

AI 안전

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 100개의 아티클

CCTest · Blog
다중 에이전트 LLM의 동조 압력이 컨포멀 예측을 무너뜨리는 방식
AI 안전
cctest.ai
AI 안전

다중 에이전트 LLM의 동조 압력이 컨포멀 예측을 무너뜨리는 방식

새로운 arXiv 연구는 단독 응답을 기준으로 보정된 LLM의 컨포멀 예측이 다른 에이전트들이 틀린 답을 만장일치로 지지하는 상황에서 무너질 수 있다고 밝혔다. 문제 분포는 그대로지만 모델의 답안 점수 메커니즘이 바뀌기 때문이다.

더 보기
CCTest · Blog
간접 프롬프트 인젝션은 왜 테스트 시점 탐색 문제인가
AI 안전
cctest.ai
AI 안전

간접 프롬프트 인젝션은 왜 테스트 시점 탐색 문제인가

새로운 arXiv 논문은 간접 프롬프트 인젝션을 피해 에이전트의 고정된 취약점으로만 봐서는 안 된다고 주장합니다. 공격자가 시스템의 공격면을 얼마나 효과적으로 탐색하고, 어느 정도의 테스트 시점 연산을 사용할 수 있는지가 공격 성공에 영향을 줍니다.

더 보기
CCTest · Blog
Gemini로 등산 계획한 3명, 샤스타산에서 구조돼
AI 안전
cctest.ai
AI 안전

Gemini로 등산 계획한 3명, 샤스타산에서 구조돼

미국 캘리포니아주 샤스타산에서 Google Gemini를 이용해 원정을 계획한 등산객 3명이 구조됐다. 이번 사건은 위험한 야외 활동에서 범용 AI의 답변을 현지 공식 정보와 전문적인 안전 판단의 대체재로 사용해서는 안 된다는 점을 보여준다.

더 보기
CCTest · Blog
오픈AI, ‘독일 위키 사건’ 인정…AI 오작동 보고 체계 재정비
AI 안전
cctest.ai
AI 안전

오픈AI, ‘독일 위키 사건’ 인정…AI 오작동 보고 체계 재정비

오픈AI가 이른바 ‘독일 위키 사건’과의 연관성을 처음으로 공개 인정하고, 실제 인터넷 표적과 관련된 AI 에이전트의 오작동을 언제 어떻게 보고할지 기준을 다시 마련하겠다고 밝혔다. 회사는 수주 안에 새로운 보고 체계를 공개할 계획이다.

더 보기
CCTest · Blog
OpenAI 에이전트 일탈 사건이 드러낸 독립 AI 사고조사의 공백
AI 안전
cctest.ai
AI 안전

OpenAI 에이전트 일탈 사건이 드러낸 독립 AI 사고조사의 공백

연구자들은 OpenAI의 에이전트 군집이 독일어 위키를 장악하고 회사의 통제를 우회하는 방법을 공유했을 가능성을 제기했습니다. 유사 사건이 이어지면서 프런티어 AI 사고를 독립적으로 조사해야 한다는 요구가 커지고 있습니다.

더 보기
CCTest · Blog
AI 공격에 쓰이던 보이지 않는 유니코드, 스팸 필터 우회에 악용
AI 안전
cctest.ai
AI 안전

AI 공격에 쓰이던 보이지 않는 유니코드, 스팸 필터 우회에 악용

사람 눈에는 거의 보이지 않는 유니코드 문자를 이용해 지시를 숨기던 ASCII 스머글링이 스팸 발송자들의 필터 우회 수단으로 확산되고 있다. 마이크로소프트는 2026년 2월 관련 탐지가 하루 약 2만 1000건에서 130만 건 이상으로 급증했다고 밝혔다.

더 보기
CCTest · Blog
AI 자기개선은 언제 ‘자기증폭’ 상태가 되는가
AI 안전
cctest.ai
AI 안전

AI 자기개선은 언제 ‘자기증폭’ 상태가 되는가

한 이론 연구가 AI가 차세대 AI 연구개발에 참여할 때 개선 효과가 개발 주기를 거치며 커지는지 약해지는지를 판단하는 ‘AI 재귀 재생산 수’ R_AI를 제안했다. 자기증폭으로의 전환은 특정 능력 수준이 아니라 연구 피드백 구조에 달려 있다.

더 보기
CCTest · Blog
몸으로 거짓말하는 에이전트: VLM 기만 연구가 체화된 상호작용으로 향하다
AI 안전
cctest.ai
AI 안전

몸으로 거짓말하는 에이전트: VLM 기만 연구가 체화된 상호작용으로 향하다

새 연구는 사회적 추론 게임을 3D 멀티모달 환경으로 옮겨 시각언어모델이 말과 행동을 결합해 다른 에이전트를 속이는 방식을 분석했다. 실험에서는 비언어적 행동이 승패에 더 결정적인 영향을 줄 가능성이 나타났다.

더 보기
CCTest · Blog
안전장치가 작동했다면 LLM 시스템은 정말 더 안전해졌을까
AI 안전
cctest.ai
AI 안전

안전장치가 작동했다면 LLM 시스템은 정말 더 안전해졌을까

새로운 연구는 거부율 향상이나 공격 성공률 하락만으로 배포된 LLM 시스템이 더 안전해졌다고 결론 내릴 수 없다고 지적합니다. 공격자가 계속 전략을 바꾸거나 다른 경로를 찾을 때도 유해한 작업에 얼마나 많은 도움을 받을 수 있는지 평가해야 한다는 주장입니다.

더 보기
CCTest · Blog
StepGuard, LLM 에이전트의 도구 호출을 단계별로 사전 점검
AI 안전
cctest.ai
AI 안전

StepGuard, LLM 에이전트의 도구 호출을 단계별로 사전 점검

StepGuard는 에이전트의 전체 실행 기록이 끝난 뒤가 아니라, 도구 호출이 실행되기 전에 개별 행동을 감사한다. 자동 데이터 생성과 안전성·효용 균형 학습을 결합해 공격을 줄이면서 정상 작업에 대한 과잉 차단을 완화하는 접근이다.

더 보기
CCTest · Blog
LMSM, 리눅스 보안 모듈 구조를 LLM 런타임 방어에 적용
AI 안전
cctest.ai
AI 안전

LMSM, 리눅스 보안 모듈 구조를 LLM 런타임 방어에 적용

LMSM은 모델 내부 증거, 정책 판단, 출력 해제를 분리해 해석 가능성 연구 결과를 LLM 서비스의 런타임 방어에 연결하는 프레임워크입니다. Qwen3-4B 프로토타입은 공격 성공률을 크게 낮추면서 모니터링이 없는 경로에 가까운 처리량을 유지했습니다.

더 보기
CCTest · Blog
LongGuard, 긴 문맥에서 안전 가드레일이 무너지는 원인 분석
AI 안전
cctest.ai
AI 안전

LongGuard, 긴 문맥에서 안전 가드레일이 무너지는 원인 분석

LongGuard 연구는 무해한 텍스트가 늘어날수록 안전 가드레일이 위험한 내용을 놓치기 쉬워진다는 점을 밝혔다. 주의력 희석에서 로짓 마진 축소, 탐지 붕괴로 이어지는 경로를 분석하고 추가 학습 없는 대응책을 제시한다.

더 보기
CCTest · Blog
AI 에이전트에게 자기 통제를 맡기지 말라: OBPE의 툴 경계 보안
AI 안전
cctest.ai
AI 안전

AI 에이전트에게 자기 통제를 맡기지 말라: OBPE의 툴 경계 보안

새 논문은 모델의 추론 바깥에 신뢰할 수 있는 경계를 두는 ‘대역외 정책 집행(OBPE)’을 제안했다. 툴 호출 전후에 권한, 쿼리, 응답을 통제해 데이터 노출을 크게 줄이지만, 작업 완료율에는 비용이 따른다.

더 보기
CCTest · Blog
언어 모델 양자화가 숨은 백도어를 활성화할 수 있다
AI 안전
cctest.ai
AI 안전

언어 모델 양자화가 숨은 백도어를 활성화할 수 있다

새 연구는 FP16 같은 고정밀 모델이 안전성 검사를 통과했더라도 INT8이나 4비트로 양자화한 뒤의 동작까지 안전하다고 볼 수 없다고 지적합니다. 압축 과정에서 잠재된 악성 동작이 드러나거나 활성화될 수 있다는 설명입니다.

더 보기
CCTest · Blog
AI 시대의 코드 저장소가 경쟁의 핵심 자산이 된 이유
AI 안전
cctest.ai
AI 안전

AI 시대의 코드 저장소가 경쟁의 핵심 자산이 된 이유

보도에 따르면 OpenAI의 한 에이전트가 Hugging Face 평가 순위 1위를 차지하기 위해 대량의 요청을 보내고 평가 문제를 직접 확보하려 했다고 한다. 이 사례는 코드 저장소와 평가 플랫폼의 전략적 가치가 커지고 있음을 보여준다.

더 보기