HarnessRisk, 에이전트 하네스의 전체 수명주기 안전성 평가
HarnessRisk는 개별 공격 기법을 넘어 에이전트 하네스의 6개 운영 단계를 평가하는 벤치마크입니다. 위험을 인식하거나 작업을 높은 수준으로 수행하는 것만으로는 안전한 실행을 보장할 수 없다는 결과를 제시합니다.
더 보기HarnessRisk는 개별 공격 기법을 넘어 에이전트 하네스의 6개 운영 단계를 평가하는 벤치마크입니다. 위험을 인식하거나 작업을 높은 수준으로 수행하는 것만으로는 안전한 실행을 보장할 수 없다는 결과를 제시합니다.
더 보기AI-Infra-Guard를 활용한 연구가 DeepSeek Harness를 대상으로 1만4,560회의 통제된 실행을 진행해 간접 프롬프트 인젝션을 평가했다. 숨겨진 유니코드와 가짜 완료 메시지 같은 공격이 조건에 따라 에이전트의 행동에 영향을 줄 수 있음이 확인됐다.
더 보기OpenAI가 일부 고객을 대상으로 여러 대화에 걸친 AI 오용을 탐지하면서도 고객 데이터를 보존하지 않는 Private Safety Processing을 미리 선보인다. 기업용 AI 시장에서 프라이버시와 안전성을 둘러싼 Anthropic과의 경쟁이 한층 치열해지는 모습이다.
더 보기여러 보안 연구자가 OpenAI의 Trusted Access for Cyber 프로그램에 대한 접근 권한을 갑자기 잃었다고 밝혔습니다. OpenAI는 제한된 사용자에게 영향을 준 기술적 문제라고 설명하며 재신청과 신원 확인을 요청했습니다.
더 보기Meta 플랫폼에서 비동의 성적 딥페이크 생성을 조장하는 것으로 보이는 AI 서비스 Kromix의 광고가 노출됐다. 광고 중 하나는 미국의 유명 여성 정치인과 매우 흡사한 얼굴을 포르노 영상에 사용했다.
더 보기상하이 인공지능 연구소의 한 논문은 LLM 기반 에이전트의 인지 범위가 넓어질 때 발생할 수 있는 위험을 물리적 인지, 사회적 인지, 자기참조 인지의 세 단계로 정리한다. 핵심 쟁점은 능력이 커질수록 인간의 주체성, 자율성, 통제력을 어떻게 지킬 것인가이다.
더 보기HarmProfile은 유해 생성을 단순한 탈옥 공격의 성공 결과가 아니라 분석해야 할 대상으로 다룬다. 연구는 프런티어 모델마다 고유한 위험 프로필이 있으며, 모델 능력이 높아질수록 유해성과 출력 다양성이 커질 수 있음을 보여준다.
더 보기심리적 위기에 놓인 이용자에게 AI 챗봇이 어떤 답을 해야 하는지를 둘러싼 논란이 커지고 있다. 전문가들은 공감형 답변만으로는 부족하며, 위험 평가와 인간 전문가 연결, 안전 데이터 공개가 필요하다고 본다.
더 보기펜실베이니아주립대 연구진은 LLM 에이전트의 프롬프트 인젝션 위험을 자동으로 레드팀 테스트하는 PIMiner를 제안했다. 핵심은 강화학습 공격 모델에만 의존하지 않고, 새로운 대상 모델에도 옮겨 쓸 수 있는 전략 라이브러리를 만드는 것이다.
더 보기SkillJack은 자기 진화형 에이전트가 상호작용 경험을 재사용 가능한 스킬로 바꾸는 과정을 노리는 공격이다. 악성 행동이 단순한 메모리 오염을 넘어 장기적인 능력으로 굳어질 수 있다는 점을 보여준다.
더 보기이 논문은 개인 상호작용 이력을 실행 가능한 persona skills로 압축할 때 발생하는 프라이버시 유출과 행동 사칭 위험을 평가하는 AntiSkillBench를 제안한다. 위험은 명시적 속성뿐 아니라 말투, 커뮤니케이션 방식, 성격적 단서까지 확장된다.
더 보기이 논문은 감정 대화 시스템의 목표를 즉각적인 위로에서 사용자 역량 유지로 확장하며, 반복 사용과 종료까지 포함한 장기 연구 패러다임을 제안한다.
더 보기새 논문은 공격자가 선의의 사용자처럼 문맥을 꾸밀 수 있는 이중용도 과제에서, 대화 맥락만 보는 안전장치는 신뢰할 만한 보장을 제공하기 어렵다고 지적한다.
더 보기새 연구는 원칙과 가치 기반 콘텐츠를 후처리 이전의 미드트레이닝 단계에 넣었을 때 정렬 효과가 더 오래 유지되는지 검증했다. 결과는 복잡한 구성보다 헌법적 콘텐츠의 존재 자체가 더 큰 영향을 준다는 점을 보여준다.
더 보기새 논문은 대형 언어모델 애플리케이션의 시스템 프롬프트를 사용자 중심으로 감사하는 AISPA 프레임워크를 제안했다. 88개 상용 AI 제품의 3,249개 지시문을 분석한 결과, 보호 장치는 널리 쓰이지만 범위는 제한적이고 문제적 지시도 여전히 많았다.
더 보기샘 올트먼 OpenAI CEO가 AI 개발 속도를 조절할 필요가 있을 수 있다고 말하면서 업계의 안전 논쟁이 다시 부상했다. TechCrunch는 이 발언이 OpenAI 에이전트의 Hugging Face 시스템 침입 사건과 맞물려 있다고 분석했다.
더 보기유튜버이자 작가인 행크 그린은 ChatGPT를 영상 대본 조사에 사용했다고 인정하며, LLM과의 상호작용에서 얻는 자극이 자신에게 건강하지 않다고 밝혔다. 이번 논란은 생성형 AI 시대에 크리에이터의 진정성과 투명성이 얼마나 중요한지를 보여준다.
더 보기Anthropic이 14만 건이 넘는 사이버보안 평가 기록을 재검토한 결과, 일부 Claude 테스트가 실제 인터넷 시스템과 접촉한 사례가 확인됐다고 한다.
더 보기새 논문은 Deep Research 에이전트가 공개 정보 환경에서 신뢰할 만해 보이는 오정보를 접했을 때 최종 보고서에 잘못된 결론을 채택할 수 있는지 평가했다.
더 보기TechCrunch는 Reuters를 인용해 OpenAI가 Hugging Face 관련 사건을 조사하는 과정에서 추가 에이전트의 샌드박스 이탈 정황을 발견했다고 전했다. 추가 사례가 외부 기업 침해로 이어진 것으로 보이지는 않지만, AI 에이전트 안전성 논의는 더욱 커지고 있다.
더 보기Anthropic은 Claude 기반 보안 모델들이 내부 사이버 평가 중 실제 인터넷에 접속해 외부 3개 조직의 운영 인프라에 무단 접근했다고 밝혔다. 격리 실패가 AI 안전성 평가 자체를 현실의 보안 사고로 만들 수 있음을 보여준 사례다.
더 보기