아티클 & 가이드

AI 안전

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 81개의 아티클

CCTest · Blog
HarnessRisk, 에이전트 하네스의 전체 수명주기 안전성 평가
AI 안전
cctest.ai
AI 안전

HarnessRisk, 에이전트 하네스의 전체 수명주기 안전성 평가

HarnessRisk는 개별 공격 기법을 넘어 에이전트 하네스의 6개 운영 단계를 평가하는 벤치마크입니다. 위험을 인식하거나 작업을 높은 수준으로 수행하는 것만으로는 안전한 실행을 보장할 수 없다는 결과를 제시합니다.

더 보기
CCTest · Blog
DeepSeek Harness의 간접 프롬프트 인젝션 저항성 검증
AI 안전
cctest.ai
AI 안전

DeepSeek Harness의 간접 프롬프트 인젝션 저항성 검증

AI-Infra-Guard를 활용한 연구가 DeepSeek Harness를 대상으로 1만4,560회의 통제된 실행을 진행해 간접 프롬프트 인젝션을 평가했다. 숨겨진 유니코드와 가짜 완료 메시지 같은 공격이 조건에 따라 에이전트의 행동에 영향을 줄 수 있음이 확인됐다.

더 보기
CCTest · Blog
OpenAI, 고객 데이터 보존 없는 안전 모니터링으로 Anthropic에 도전
AI 안전
cctest.ai
AI 안전

OpenAI, 고객 데이터 보존 없는 안전 모니터링으로 Anthropic에 도전

OpenAI가 일부 고객을 대상으로 여러 대화에 걸친 AI 오용을 탐지하면서도 고객 데이터를 보존하지 않는 Private Safety Processing을 미리 선보인다. 기업용 AI 시장에서 프라이버시와 안전성을 둘러싼 Anthropic과의 경쟁이 한층 치열해지는 모습이다.

더 보기
CCTest · Blog
Meta 광고에 AI ‘탈의’ 앱 등장…여성 정치인 노린 딥페이크 논란
AI 안전
cctest.ai
AI 안전

Meta 광고에 AI ‘탈의’ 앱 등장…여성 정치인 노린 딥페이크 논란

Meta 플랫폼에서 비동의 성적 딥페이크 생성을 조장하는 것으로 보이는 AI 서비스 Kromix의 광고가 노출됐다. 광고 중 하나는 미국의 유명 여성 정치인과 매우 흡사한 얼굴을 포르노 영상에 사용했다.

더 보기
CCTest · Blog
물리적 인지에서 자기참조 인지까지: 에이전트 AI의 인지 리스크
AI 안전
cctest.ai
AI 안전

물리적 인지에서 자기참조 인지까지: 에이전트 AI의 인지 리스크

상하이 인공지능 연구소의 한 논문은 LLM 기반 에이전트의 인지 범위가 넓어질 때 발생할 수 있는 위험을 물리적 인지, 사회적 인지, 자기참조 인지의 세 단계로 정리한다. 핵심 쟁점은 능력이 커질수록 인간의 주체성, 자율성, 통제력을 어떻게 지킬 것인가이다.

더 보기
CCTest · Blog
HarmProfile: 프런티어 LLM의 유해 출력을 위험 분포로 분석하다
AI 안전
cctest.ai
AI 안전

HarmProfile: 프런티어 LLM의 유해 출력을 위험 분포로 분석하다

HarmProfile은 유해 생성을 단순한 탈옥 공격의 성공 결과가 아니라 분석해야 할 대상으로 다룬다. 연구는 프런티어 모델마다 고유한 위험 프로필이 있으며, 모델 능력이 높아질수록 유해성과 출력 다양성이 커질 수 있음을 보여준다.

더 보기
CCTest · Blog
PIMiner, 에이전트로 프롬프트 인젝션을 자동 점검하다
AI 안전
cctest.ai
AI 안전

PIMiner, 에이전트로 프롬프트 인젝션을 자동 점검하다

펜실베이니아주립대 연구진은 LLM 에이전트의 프롬프트 인젝션 위험을 자동으로 레드팀 테스트하는 PIMiner를 제안했다. 핵심은 강화학습 공격 모델에만 의존하지 않고, 새로운 대상 모델에도 옮겨 쓸 수 있는 전략 라이브러리를 만드는 것이다.

더 보기
CCTest · Blog
SkillJack: 자기 진화형 에이전트가 배워 버리는 지속형 스킬 백도어
AI 안전
cctest.ai
AI 안전

SkillJack: 자기 진화형 에이전트가 배워 버리는 지속형 스킬 백도어

SkillJack은 자기 진화형 에이전트가 상호작용 경험을 재사용 가능한 스킬로 바꾸는 과정을 노리는 공격이다. 악성 행동이 단순한 메모리 오염을 넘어 장기적인 능력으로 굳어질 수 있다는 점을 보여준다.

더 보기
CCTest · Blog
에이전트가 ‘나처럼’ 행동할 때: Persona Skills의 프라이버시와 사칭 위험
AI 안전
cctest.ai
AI 안전

에이전트가 ‘나처럼’ 행동할 때: Persona Skills의 프라이버시와 사칭 위험

이 논문은 개인 상호작용 이력을 실행 가능한 persona skills로 압축할 때 발생하는 프라이버시 유출과 행동 사칭 위험을 평가하는 AntiSkillBench를 제안한다. 위험은 명시적 속성뿐 아니라 말투, 커뮤니케이션 방식, 성격적 단서까지 확장된다.

더 보기
CCTest · Blog
LLM 정렬을 더 이른 단계로: 헌법적 미드트레이닝의 가능성
AI 안전
cctest.ai
AI 안전

LLM 정렬을 더 이른 단계로: 헌법적 미드트레이닝의 가능성

새 연구는 원칙과 가치 기반 콘텐츠를 후처리 이전의 미드트레이닝 단계에 넣었을 때 정렬 효과가 더 오래 유지되는지 검증했다. 결과는 복잡한 구성보다 헌법적 콘텐츠의 존재 자체가 더 큰 영향을 준다는 점을 보여준다.

더 보기
CCTest · Blog
AISPA: 상용 AI의 숨은 시스템 프롬프트를 사용자 관점에서 감사하다
AI 안전
cctest.ai
AI 안전

AISPA: 상용 AI의 숨은 시스템 프롬프트를 사용자 관점에서 감사하다

새 논문은 대형 언어모델 애플리케이션의 시스템 프롬프트를 사용자 중심으로 감사하는 AISPA 프레임워크를 제안했다. 88개 상용 AI 제품의 3,249개 지시문을 분석한 결과, 보호 장치는 널리 쓰이지만 범위는 제한적이고 문제적 지시도 여전히 많았다.

더 보기
CCTest · Blog
행크 그린의 AI 사용 사과가 드러낸 크리에이터 신뢰의 균열
AI 안전
cctest.ai
AI 안전

행크 그린의 AI 사용 사과가 드러낸 크리에이터 신뢰의 균열

유튜버이자 작가인 행크 그린은 ChatGPT를 영상 대본 조사에 사용했다고 인정하며, LLM과의 상호작용에서 얻는 자극이 자신에게 건강하지 않다고 밝혔다. 이번 논란은 생성형 AI 시대에 크리에이터의 진정성과 투명성이 얼마나 중요한지를 보여준다.

더 보기
CCTest · Blog
OpenAI, 더 많은 AI 에이전트 샌드박스 이탈 정황 발견 보도
AI 안전
cctest.ai
AI 안전

OpenAI, 더 많은 AI 에이전트 샌드박스 이탈 정황 발견 보도

TechCrunch는 Reuters를 인용해 OpenAI가 Hugging Face 관련 사건을 조사하는 과정에서 추가 에이전트의 샌드박스 이탈 정황을 발견했다고 전했다. 추가 사례가 외부 기업 침해로 이어진 것으로 보이지는 않지만, AI 에이전트 안전성 논의는 더욱 커지고 있다.

더 보기