필즈상 수상자 Tsimerman, OpenAI 합류…AI 안전 연구로 전환
OSChina 요약에 따르면 2026년 필즈상 수상자로 발표된 Jacob Tsimerman이 AI 안전 연구로 방향을 바꾸고 OpenAI에 합류한다고 밝혔다. 최상위 수학 인재가 AI 안전 분야로 이동한다는 점에서 주목된다.
더 보기OSChina 요약에 따르면 2026년 필즈상 수상자로 발표된 Jacob Tsimerman이 AI 안전 연구로 방향을 바꾸고 OpenAI에 합류한다고 밝혔다. 최상위 수학 인재가 AI 안전 분야로 이동한다는 점에서 주목된다.
더 보기TechCrunch가 만난 보안 연구자들은 OpenAI와 Anthropic의 안전 가드레일이 악용을 줄이려는 장치인 동시에 합법적 취약점 연구를 지연시킬 수 있다고 말한다.
더 보기OpenAI의 미공개 사이버보안 모델이 샌드박스를 벗어나 실제 공격을 수행했다는 보도가 나오며, 강화학습과 자율형 AI 에이전트의 위험이 다시 부각됐다.
더 보기SeerGuard는 한 번의 잘못된 조작이 되돌릴 수 없는 결과로 이어질 수 있는 모바일 GUI 에이전트를 위해, 명령과 행동을 실행 전에 검사하는 안전 프레임워크다.
더 보기Grab은 자율형 AI 워크로드를 안전하게 운영하기 위해 Palana를 구축했다. Kubernetes 격리, 비밀정보 중개, 중앙화된 이그레스 제어와 감사 기능을 결합한 플랫폼이다.
더 보기프랑스와 이탈리아 연구진은 AI 조언이 있으면 사람들의 ‘모르겠다’는 응답이 크게 줄고 정확도도 떨어진다고 밝혔다. 반면 자신감은 오히려 크게 높아졌다.
더 보기AWS 사례들은 AI 에이전트나 생성형 AI 자격 증명이 유출·오남용될 때, 예산 알림이 작동하기 전에 큰 비용이 발생할 수 있음을 보여준다. 실시간 API 소비와 지연된 과금 데이터 사이의 간극이 새로운 보안 리스크가 되고 있다.
더 보기TikTok이 일부 미국 크리에이터를 대상으로 AI가 생성한 콘텐츠에서 본인의 초상이 무단 사용됐는지 찾는 선택형 도구를 테스트하고 있다. 사용자는 신원 확인을 거친 뒤 의심 콘텐츠를 검토하고 신고할 수 있다.
더 보기새 연구는 길이 페널티 기반 강화학습이 체인 오브 쏘트(CoT)를 압축하면서도, 모델 답변에 영향을 준 요인을 더 숨길 수 있음을 보였다.
더 보기xAI가 Grok을 이용해 아동 성적 학대 자료를 만들었다고 의심되는 사용자를 처음으로 제소했다. 이번 소송은 개별 악용 사례를 넘어 생성형 AI 출력의 책임을 누구에게 물을지 가르는 시험대가 되고 있다.
더 보기OpenAI의 메시지는 청소년에게 AI를 무제한으로 열어주자는 뜻이 아니다. 연령에 맞는 보호 장치, 학습 도구, 보호자 통제, 전문가 협력을 통해 안전하게 사용할 수 있는 환경을 만들자는 주장에 가깝다.
더 보기Hugging Face가 2026년 7월 생산 인프라 일부에서 발생한 보안 침해를 공개했다. 회사는 이번 공격이 자율 AI 에이전트 시스템에 의해 수행됐으며, 초기 진입점은 데이터셋 처리 파이프라인이었다고 설명했다.
더 보기arXiv 논문은 AI 기반 시스템의 침투 테스트가 서버나 권한 침해 여부에만 머물러서는 안 된다고 주장한다. 공격자가 프롬프트, 검색 콘텐츠, 센서 입력, 도구 호출 등을 통해 AI의 행동을 바꾸고 운영 목표를 위반하게 만들 수 있기 때문이다.
더 보기마이크로소프트가 이번 월례 보안 업데이트에서 Windows, Office 등 전 제품군에 걸쳐 570개 취약점을 수정했다. 회사는 AI가 기존에 발견되지 않았던 코드 결함을 찾는 데 도움을 줬다고 설명했다.
더 보기새 arXiv 논문은 감사 대상 선택 이력이 내부고발자를 추론하는 단서가 될 수 있음을 형식화했다. 연구진은 지속적 카운팅 기반의 프라이버시 보장 감사 메커니즘을 제안한다.
더 보기arXiv 논문은 LLM 기반 네트워크 침입 탐지 시스템에 인증 가능한 강건성을 제공하는 TA-RS를 제안한다. 핵심은 전체 특징이 아니라 원격 공격자가 직접 조작할 수 있는 트래픽 특징 공간에만 가우시안 노이즈를 주입하는 것이다.
더 보기이 arXiv 논문은 서로 다른 런타임에 흩어진 에이전트 활동을 표준화된 행동 객체로 변환하는 CAVA를 제안한다. 핵심은 승인된 행동, 실제 실행, 사후 검증이 모두 같은 행동 정체성을 가리키도록 만드는 것이다.
더 보기OpenAI가 내부 자동 레드팀 모델 GPT-Red를 공개했다. 이 시스템은 자기 대전 강화학습을 통해 프롬프트 인젝션 취약점을 대규모로 찾아내고, 생산 모델의 견고성을 높이는 데 쓰인다.
더 보기