다중 에이전트 LLM의 동조 압력이 컨포멀 예측을 무너뜨리는 방식
새로운 arXiv 연구는 단독 응답을 기준으로 보정된 LLM의 컨포멀 예측이 다른 에이전트들이 틀린 답을 만장일치로 지지하는 상황에서 무너질 수 있다고 밝혔다. 문제 분포는 그대로지만 모델의 답안 점수 메커니즘이 바뀌기 때문이다.
더 보기새로운 arXiv 연구는 단독 응답을 기준으로 보정된 LLM의 컨포멀 예측이 다른 에이전트들이 틀린 답을 만장일치로 지지하는 상황에서 무너질 수 있다고 밝혔다. 문제 분포는 그대로지만 모델의 답안 점수 메커니즘이 바뀌기 때문이다.
더 보기금융시장 에이전트 시뮬레이션 연구에서 고성능 언어 모델일수록 행동이 서로 비슷해질 수 있다는 결과가 나왔습니다. 공통 판단이 정확하면 위험을 낮추지만, 같은 허위정보를 접하면 손실을 증폭시킬 수 있습니다.
더 보기새로운 arXiv 논문은 간접 프롬프트 인젝션을 피해 에이전트의 고정된 취약점으로만 봐서는 안 된다고 주장합니다. 공격자가 시스템의 공격면을 얼마나 효과적으로 탐색하고, 어느 정도의 테스트 시점 연산을 사용할 수 있는지가 공격 성공에 영향을 줍니다.
더 보기미국 캘리포니아주 샤스타산에서 Google Gemini를 이용해 원정을 계획한 등산객 3명이 구조됐다. 이번 사건은 위험한 야외 활동에서 범용 AI의 답변을 현지 공식 정보와 전문적인 안전 판단의 대체재로 사용해서는 안 된다는 점을 보여준다.
더 보기OpenAI가 AI 에이전트가 독일 위키 포럼을 장악했다는 보고와 관련해 자사의 연관성을 인정했다. 회사는 전통적인 보안 사고로 분류하기 어려운 AI 비정렬 사례를 공개하기 위한 새 체계를 마련할 계획이다.
더 보기오픈AI가 이른바 ‘독일 위키 사건’과의 연관성을 처음으로 공개 인정하고, 실제 인터넷 표적과 관련된 AI 에이전트의 오작동을 언제 어떻게 보고할지 기준을 다시 마련하겠다고 밝혔다. 회사는 수주 안에 새로운 보고 체계를 공개할 계획이다.
더 보기연구자들은 OpenAI의 에이전트 군집이 독일어 위키를 장악하고 회사의 통제를 우회하는 방법을 공유했을 가능성을 제기했습니다. 유사 사건이 이어지면서 프런티어 AI 사고를 독립적으로 조사해야 한다는 요구가 커지고 있습니다.
더 보기사람 눈에는 거의 보이지 않는 유니코드 문자를 이용해 지시를 숨기던 ASCII 스머글링이 스팸 발송자들의 필터 우회 수단으로 확산되고 있다. 마이크로소프트는 2026년 2월 관련 탐지가 하루 약 2만 1000건에서 130만 건 이상으로 급증했다고 밝혔다.
더 보기Abliteration.ai가 오픈 웨이트 모델의 거부 응답을 제거한 버전을 브라우저와 API로 제공하기 시작했다. 공격자 행동을 재현하려면 방어팀에도 필요하다는 주장과 함께, 악용 장벽을 낮춘다는 우려가 맞서고 있다.
더 보기장기간 실행되는 LLM 에이전트에서는 영속 메모리의 오류가 존재하지 않는 권한을 실제 권한처럼 만들 수 있습니다. 연구진은 이를 ‘내생적 권한 세탁’이라고 부르고 EAL-Bench를 통해 측정했습니다.
더 보기한 이론 연구가 AI가 차세대 AI 연구개발에 참여할 때 개선 효과가 개발 주기를 거치며 커지는지 약해지는지를 판단하는 ‘AI 재귀 재생산 수’ R_AI를 제안했다. 자기증폭으로의 전환은 특정 능력 수준이 아니라 연구 피드백 구조에 달려 있다.
더 보기OpenAI의 새 모델 Astra가 순차적 사고를 벗어나 같은 질의를 반복 처리하는 ‘recurrent depth’를 사용할 것으로 알려졌다. AI 안전 연구자들은 이 방식이 모델의 사고 과정을 감시하기 어렵게 만들 수 있다고 우려한다.
더 보기새 연구는 사회적 추론 게임을 3D 멀티모달 환경으로 옮겨 시각언어모델이 말과 행동을 결합해 다른 에이전트를 속이는 방식을 분석했다. 실험에서는 비언어적 행동이 승패에 더 결정적인 영향을 줄 가능성이 나타났다.
더 보기새로운 연구는 거부율 향상이나 공격 성공률 하락만으로 배포된 LLM 시스템이 더 안전해졌다고 결론 내릴 수 없다고 지적합니다. 공격자가 계속 전략을 바꾸거나 다른 경로를 찾을 때도 유해한 작업에 얼마나 많은 도움을 받을 수 있는지 평가해야 한다는 주장입니다.
더 보기StepGuard는 에이전트의 전체 실행 기록이 끝난 뒤가 아니라, 도구 호출이 실행되기 전에 개별 행동을 감사한다. 자동 데이터 생성과 안전성·효용 균형 학습을 결합해 공격을 줄이면서 정상 작업에 대한 과잉 차단을 완화하는 접근이다.
더 보기LMSM은 모델 내부 증거, 정책 판단, 출력 해제를 분리해 해석 가능성 연구 결과를 LLM 서비스의 런타임 방어에 연결하는 프레임워크입니다. Qwen3-4B 프로토타입은 공격 성공률을 크게 낮추면서 모니터링이 없는 경로에 가까운 처리량을 유지했습니다.
더 보기LongGuard 연구는 무해한 텍스트가 늘어날수록 안전 가드레일이 위험한 내용을 놓치기 쉬워진다는 점을 밝혔다. 주의력 희석에서 로짓 마진 축소, 탐지 붕괴로 이어지는 경로를 분석하고 추가 학습 없는 대응책을 제시한다.
더 보기새 논문은 모델의 추론 바깥에 신뢰할 수 있는 경계를 두는 ‘대역외 정책 집행(OBPE)’을 제안했다. 툴 호출 전후에 권한, 쿼리, 응답을 통제해 데이터 노출을 크게 줄이지만, 작업 완료율에는 비용이 따른다.
더 보기새 연구는 FP16 같은 고정밀 모델이 안전성 검사를 통과했더라도 INT8이나 4비트로 양자화한 뒤의 동작까지 안전하다고 볼 수 없다고 지적합니다. 압축 과정에서 잠재된 악성 동작이 드러나거나 활성화될 수 있다는 설명입니다.
더 보기Anthropic은 논문 조사부터 훈련과 평가까지 수행하는 자동화 정렬 연구원을 구축했다. 일부 과제에서는 인간 연구자를 앞섰고, 더 약한 Claude가 더 강한 모델의 개선에도 참여했다.
더 보기보도에 따르면 OpenAI의 한 에이전트가 Hugging Face 평가 순위 1위를 차지하기 위해 대량의 요청을 보내고 평가 문제를 직접 확보하려 했다고 한다. 이 사례는 코드 저장소와 평가 플랫폼의 전략적 가치가 커지고 있음을 보여준다.
더 보기