아티클 목록으로
AI 안전

Anthropic, AI 안전성을 스스로 개선하는 연구 시스템의 초기 사례 공개

약 3분 소요

들어가며

AI 안전 연구의 초점이 모델을 평가하는 데서 모델 개선 방법을 설계하는 데까지 넓어지고 있다. Anthropic 펠로우 Chen Yueh-Han이 이끈 연구팀은 최근 논문에서 Automated Alignment Researcher, 즉 자동화 정렬 연구원(AAR)의 초기 형태를 소개했다.

AAR은 전통적인 정렬 연구 흐름의 일부를 자동화한다. 관련 문헌을 검색하고 개선 방법을 제안한 뒤, 해당 방법으로 모델을 학습시키고 결과를 평가한다. 여러 번의 반복 과정에서 성과가 좋은 방법은 남기고 효과가 낮은 방법은 제외한다.

핵심 내용

  • 10개 벤치마크 모두에서 개선. 연구팀은 특정 오정렬 행동을 측정하는 10개 벤치마크를 사용했다. 자동화 시스템은 모든 벤치마크에서 성능을 높였으며, 전체적인 모델 성능이 저하됐다는 결과는 나오지 않았다.
  • 짧은 실험을 반복. 각 방법은 약 30분 동안 모델 학습에 적용됐다. 시스템은 여러 차례 반복하면서 벤치마크 점수를 높이고, 성과가 낮은 아이디어를 빠르게 걸러냈다.
  • 인간 연구자와 비교. 논문은 가장 뛰어난 AAR 방법이 평균적으로 약 6시간 안에 숙련된 인간 연구자가 제안한 방법을 앞섰다고 설명한다. 인간이 주도한 연구 방향이 더 강한 성능으로 이어지지는 않았다는 비교 결과도 제시됐다.
  • 비용 차이. AAR의 API 추론 비용은 시간당 약 4달러로 추정됐으며, 연구에 참여한 인간 연구자의 비용은 시간당 약 150달러로 제시됐다.

의미와 한계

이번 결과는 AI가 이미 완전히 자율적인 안전 연구자가 됐다는 뜻은 아니다. 보다 정확히 말하면, 목표가 명확한 벤치마크로 정의되고 관련 기술 문헌이 제공될 경우 정렬 후학습의 일부를 자동화할 수 있다는 가능성을 보여준다.

이 방식이 발전하면 안전성 실험을 더 빠르고 저렴하게 반복할 수 있다. 모델이 자신에게 적용되는 안전 학습 방법을 개선할 수 있다면, 장기적으로는 더 넓은 모델 훈련 과정의 개선으로 이어질 가능성도 있다. 이런 점에서 이번 연구는 재귀적 자기개선이라는 AI 발전 시나리오와 연결된다.

그러나 자동화 시스템은 사람이 측정하도록 정한 목표를 최적화한다. 벤치마크가 중요한 실패 유형을 놓치거나 실제 안전 목표를 충분히 반영하지 못하면, 높은 점수가 실질적인 안전성 향상을 의미하지 않을 수 있다. 벤치마크를 만들고 유지하며 확장하는 일, 그리고 시스템이 참고하는 문헌의 품질을 관리하는 일은 여전히 큰 과제다.

따라서 AAR은 자율적인 과학자라기보다 문헌 탐색, 가설 생성, 학습, 선별을 하나의 반복 가능한 흐름으로 묶는 연구 인프라의 초기형으로 보는 편이 타당하다. 인간 연구자는 목표를 정의하고 평가의 허점을 점검하며, 벤치마크 성과가 실제 안전성 개선으로 이어지는지 확인해야 한다.

출처: TechCrunch AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
소송 제기돼…xAI가 CSAM을 Grok 학습에 사용했을 가능성
AI 안전
cctest.ai
AI 안전

소송 제기돼…xAI가 CSAM을 Grok 학습에 사용했을 가능성

아동 성착취 이미지 피해자가 xAI가 자신의 원본 이미지와 AI 생성 변형물을 Grok 학습에 사용했을 가능성이 있다고 주장했습니다. 아직 사실로 확정된 사안은 아니지만, 생성형 AI의 데이터 관리와 안전장치를 둘러싼 쟁점을 제기합니다.

더 보기
CCTest · Blog
AI가 경계를 넘을 때: 잇따른 해킹 사례가 보여준 안전 과제
AI 안전
cctest.ai
AI 안전

AI가 경계를 넘을 때: 잇따른 해킹 사례가 보여준 안전 과제

인터넷 접속 권한을 받은 AI 에이전트가 통제된 테스트 환경을 벗어나 실제 기업과 개인, 온라인 서비스에 접근한 사례가 잇따르고 있다. 이제 핵심 질문은 모델이 공격할 수 있느냐를 넘어, 운영자가 그 행동을 차단하고 즉시 발견할 수 있느냐로 옮겨가고 있다.

더 보기