아티클 목록으로
AI 에이전트

Astra와 Opus, 튜링의 또 다른 시험에 도전하다

약 3분 소요

들어가며

앨런 튜링은 기계의 지능을 인간의 지능과 구분할 수 있는지를 묻는 ‘튜링 테스트’로 가장 널리 알려져 있다. 그러나 그의 생애에서 더 직접적이고 역사적인 영향을 남긴 과제는 제2차 세계대전 당시 나치 독일이 사용한 에니그마 암호를 해독하는 일이었다. 전쟁 중 해독 작업이 끝난 뒤에도 원문을 잘못 옮긴 기록이나 송신자의 오류 때문에 일부 메시지는 여전히 풀리지 않은 채 남아 있다.

최근 현대의 대규모 언어 모델이 그 미완의 작업 일부에 도전했다. 암호 연구자들에 따르면 OpenAI의 Astra와 Anthropic의 Claude Opus는 오랫동안 해독되지 않았던 서로 다른 에니그마 메시지 두 건의 평문을 복원하는 데 성공했다.

핵심 내용

  • 개발자 Carter Leffen은 에니그마 메시지 데이터베이스에서 미해독 기록을 찾고 해독하도록 Astra에 요청했다.
  • Astra는 자료를 검색하고 역사적 맥락과 단서를 분석했으며, 에니그마 기계의 시뮬레이터를 직접 제작하면서 해독을 진행한 것으로 전해졌다.
  • 그 결과 2005년부터 연구자들을 막아섰던 메시지의 평문을 복원했다. 자료 사이트 Crypto Cellar를 운영하는 Frode Weierud가 Leffen의 해답을 검증했다.
  • Astra의 로그에는 비공개 자료 모음에 대한 언급도 있었다. 다만 모델이 실제로 해당 자료에 접근했는지, 다른 연구자가 온라인에 공개한 정보를 찾았는지, 독일의 공개 기록을 활용했는지는 확인되지 않았다.
  • Jack Willis는 이후 Claude Opus를 이용해 다른 메시지를 해독했다. 이 과정에서는 특정 장교의 이름이라는 구체적인 단서를 포함해 Astra보다 많은 안내가 제공됐다.
  • Weierud에 따르면 현재도 미해독 에니그마 메시지는 일곱 건이며, 평문은 알려졌지만 암호 설정을 풀지 못한 사례도 한 건 남아 있다.

의미와 영향

이번 사례의 의미는 AI가 단순히 가능한 조합을 대량으로 시도했다는 데 있지 않다. 에니그마 연구에서는 불완전한 암호문, 역사 기록, 당시의 통신 관행, 군사적 맥락, 필사 오류 가능성을 함께 해석해야 한다. Astra의 작업이 주목받는 이유는 자료 검색과 가설 수립, 프로그래밍, 후보 해답 검증을 하나의 작업 흐름으로 연결했기 때문이다.

이는 한 번의 질문에 답하는 챗봇보다, 여러 단계의 연구 목표를 추적하는 AI 에이전트에 가까운 활용이다. Weierud는 Astra가 이틀 동안 수행한 작업이 인간 연구자에게는 수주 또는 수개월이 걸릴 수 있다고 평가했다. 다만 이는 통제된 성능 비교가 아니라 개인적인 판단이다.

그렇다고 모델이 암호학자를 대체했다고 보기는 어렵다. Claude Opus에는 결정적인 인간의 단서가 제공됐고, Astra가 어떤 정보를 실제로 활용했는지도 완전히 밝혀지지 않았다. 모델이 공개 자료를 재조합한 것인지, 어떤 기록이 해답에 결정적이었는지 확인하려면 추가 검증이 필요하다. 역사 연구에 AI를 적용할 때는 재현 가능한 절차, 출처 감사, 독립적인 검토가 필수적이다.

에니그마는 실질적 지능을 평가하는 까다로운 시험이기도 하다. 정답이 정리된 데이터 세트에 들어 있는 것이 아니라 증거가 불완전하고 기록에 오류가 있으며, 모델이 필요에 따라 조사 도구까지 만들어야 하기 때문이다. 남은 메시지에 대한 연구가 이어진다면 중요한 질문은 AI가 ‘또 다른 튜링 테스트’를 통과했는지가 아닐 수 있다. 인간과 AI가 업무를 어떻게 나누고, 결과를 얼마나 신뢰성 있게 검증할 수 있는지가 더 본질적인 기준이 될 것이다.

출처: TechCrunch AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
구글, 인도에서 Gemini로 Flipkart 상품 직접 구매 테스트
AI 에이전트
cctest.ai
AI 에이전트

구글, 인도에서 Gemini로 Flipkart 상품 직접 구매 테스트

구글이 인도에서 Gemini와 Google AI Mode에 표시된 일부 Flipkart 상품을 AI 화면에서 바로 구매하는 기능을 테스트하고 있다. ‘구매’ 버튼을 누르면 Flipkart 브랜드 결제 흐름으로 이동하며, 10월 후반 확대 출시가 예상된다.

더 보기
CCTest · Blog
DeepSeek DSec, 대규모 에이전트 훈련을 위한 탄력적 샌드박스 인프라
AI 에이전트
cctest.ai
AI 에이전트

DeepSeek DSec, 대규모 에이전트 훈련을 위한 탄력적 샌드박스 인프라

DeepSeek의 DSec는 에이전트 훈련과 평가를 위한 프로덕션 샌드박스 플랫폼이다. 함수 호출, 컨테이너, microVM, 전체 VM을 하나의 SDK로 통합하고 상태 유지, 이미지 배포, 클러스터 자원 관리를 함께 처리한다.

더 보기
CCTest · Blog
DoorDash, 멀티 에이전트 LLM으로 6만 개 Feature Flag 정리
AI 에이전트
cctest.ai
AI 에이전트

DoorDash, 멀티 에이전트 LLM으로 6만 개 Feature Flag 정리

DoorDash가 코드베이스에서 오래된 Feature Flag를 제거하기 위해 멀티 에이전트 LLM 워크플로를 구축했다. 실험 데이터, 엔지니어 승인, 격리된 Git Worktree, 자동 검증을 결합했으며 복잡한 호출 경로는 사람의 개입을 남겨뒀다.

더 보기