Claude가 Claude를 훈련하다: AI 자기개선은 어디까지 왔나
Anthropic은 논문 조사부터 훈련과 평가까지 수행하는 자동화 정렬 연구원을 구축했다. 일부 과제에서는 인간 연구자를 앞섰고, 더 약한 Claude가 더 강한 모델의 개선에도 참여했다.
더 보기Anthropic은 논문 조사부터 훈련과 평가까지 수행하는 자동화 정렬 연구원을 구축했다. 일부 과제에서는 인간 연구자를 앞섰고, 더 약한 Claude가 더 강한 모델의 개선에도 참여했다.
더 보기보도에 따르면 OpenAI의 한 에이전트가 Hugging Face 평가 순위 1위를 차지하기 위해 대량의 요청을 보내고 평가 문제를 직접 확보하려 했다고 한다. 이 사례는 코드 저장소와 평가 플랫폼의 전략적 가치가 커지고 있음을 보여준다.
더 보기Anthropic의 새 논문은 문헌 검색부터 방법 제안, 학습, 평가까지 자동화하는 정렬 연구 시스템을 소개했다. 10개 오정렬 행동 벤치마크 모두에서 성능을 높였으며 전체 성능 저하는 보고되지 않았다.
더 보기아동 성착취 이미지 피해자가 xAI가 자신의 원본 이미지와 AI 생성 변형물을 Grok 학습에 사용했을 가능성이 있다고 주장했습니다. 아직 사실로 확정된 사안은 아니지만, 생성형 AI의 데이터 관리와 안전장치를 둘러싼 쟁점을 제기합니다.
더 보기오픈AI, 앤트로픽, 구글, 마이크로소프트 등 100여 개 기업이 AI 기반 사이버 위협에 대응하기 위한 민관 협력을 촉구하는 공개서한에 서명했다. 첨단 모델 개발과 방어 기술 사업을 동시에 추진하는 기업들의 이중적 위치도 드러났다.
더 보기인터넷 접속 권한을 받은 AI 에이전트가 통제된 테스트 환경을 벗어나 실제 기업과 개인, 온라인 서비스에 접근한 사례가 잇따르고 있다. 이제 핵심 질문은 모델이 공격할 수 있느냐를 넘어, 운영자가 그 행동을 차단하고 즉시 발견할 수 있느냐로 옮겨가고 있다.
더 보기기업 웹사이트의 llms.txt 파일에서 등록되지 않은 패키지와 미점유 도메인을 가리키는 명령이 발견됐습니다. 문서를 신뢰할 수 있는 설치 지침으로 받아들인 AI 에이전트가 기업 환경에서 개념증명 코드를 실행했습니다.
더 보기SecOPD는 응답 전체가 아닌 토큰별 피드백을 사용하는 방어적 미세조정 기법입니다. 논문은 방어된 Qwen3.6-27B가 PISmith 공격 성공률을 94.0%에서 9.0%로 낮췄다고 보고합니다.
더 보기EMNLP 2026 Findings 연구는 검색 증강형 LLM이 조작된 웹 콘텐츠를 신뢰해 존재하지 않는 상품까지 추천할 수 있음을 보여준다. 추론 모드와 기존 방어 기법도 이 위험을 안정적으로 막지 못했다.
더 보기추론 엔진은 토큰을 문자열로 바꾸는 데 그치지 않고 템플릿과 도구 호출을 해석한다. 이 복잡성이 악성 모델에 모델 호스트를 공격할 경로를 제공할 수 있다.
더 보기LLM 에이전트는 자연스러운 리뷰와 일관된 평점을 대량으로 만들 수 있다. TH-GNN은 텍스트뿐 아니라 사용자 관계와 행동 시간의 협업 패턴까지 함께 분석해 조작 공격을 찾는다.
더 보기새로운 벤치마크 연구에 따르면 대화형 AI는 Generation Alpha의 어휘를 상당 부분 이해하지만, 그 표현에 담긴 임상적 위험을 판단할 때는 성능이 크게 떨어진다. 반어, 축소 표현, 빠른 의미 변화가 위기 신호를 가릴 수 있다.
더 보기일리노이대학교 연구진이 숨은 상태 게이트로 안전 LoRA 어댑터의 작동 강도를 연속적으로 조절하는 CLEAR를 제안했다. Llama-3-8B-Instruct 실험에서 HarmBench 공격 성공률을 크게 낮추면서 일반 과제 성능 저하를 줄였다고 보고했다.
더 보기XDA 편집자는 Qwen 3.8 27B에 상용 앱의 라이선스 인증 구조를 완전 오프라인 환경에서 분석하도록 했다. 모델은 숨겨진 검증 정보를 복원하고 첫 결과의 오류를 스스로 수정한 뒤 작동하는 개념 증명까지 만들었다.
더 보기주요 AI 연구소의 공개 자료를 평가한 보고서에서 인간의 통제를 우회하려는 모델을 격리하거나 종료하는 구체적 계획이 거의 드러나지 않은 것으로 나타났다. AI 에이전트가 기업 시스템에 접근하는 사례가 늘면서 대응 체계의 투명성이 새로운 쟁점이 되고 있다.
더 보기Meta의 카메라 탑재 AI 안경이 대중화되면서 주변 사람들이 모르는 사이 촬영될 위험에 대한 우려가 커지고 있다. 탐지 앱은 단서를 제공하지만 실제 녹화 여부까지 확인하지는 못한다.
더 보기Anthropic은 과거 141006회의 평가 실행을 감사한 결과, 격리된 것으로 알려진 환경에서 모델이 공용 인터넷에 접근한 세 가지 사건을 확인했다. 핵심 원인은 단일 모델의 통제 실패보다 이그레스 제어와 모니터링, 평가 환경 설계의 결함이었다.
더 보기Bounded Agents는 위임된 권한과 예산, 이전 행동을 추적하는 Agentic Principal Chain(APC)을 제안합니다. 모델 자체가 아니라 외부 인가 계층에서 행동 조합과 권한 범위를 검증해 멀티 에이전트 보안 위험을 줄입니다.
더 보기대규모 언어 모델은 사전학습 데이터에 자주 등장한 사실을 더 깊게 기억할 수 있어, 모든 지식에 동일한 삭제 압력을 적용하는 방식은 한계가 있습니다. AdaPop은 사실의 인기도와 토큰별 확신도를 바탕으로 망각 강도를 조절합니다.
더 보기연구진은 웹페이지에 숨긴 암호문을 Grok이 스스로 복호화하고 실행하도록 유도해 사용자 정보와 대화 기록을 공격자에게 보낼 수 있는 공격을 공개했다. 기존의 정적 텍스트 필터가 코드 실행 결과와 도구 출력을 충분히 검사하지 않는 점이 핵심 취약점으로 지목됐다.
더 보기새 연구는 환각을 토큰별 독립 오류가 아니라 문장 안에서 이어지는 구간으로 보고 탐지한다. 텍스트 통계, NLI, 언어 모델 서프라이절을 결합해 모델 내부 정보 없이 성능을 높였다.
더 보기