Gemini 3.8 Flash 공개: 장기 코딩과 방어형 사이버 보안 강화
개요
Google DeepMind가 Gemini 3.8 Flash와 Gemini 3.8 Flash Cyber를 발표했습니다. 두 모델은 동일한 기반 지능을 공유하지만 적용 분야는 다릅니다. 일반 버전은 에이전트형 작업, 소프트웨어 엔지니어링, 전문 영역의 복합 분석을 대상으로 하며, Cyber 버전은 취약점 발견과 자동 수정 등 방어적 사이버 보안 업무에 초점을 맞춥니다.
핵심 내용
- 장기 코딩 성능 향상. Gemini 3.8 Flash는 복잡한 엔지니어링 문제를 처음부터 끝까지 처리하도록 설계됐습니다. Google은 DeepSWE v1.1 장기 소프트웨어 엔지니어링 평가에서의 개선과 함께 금융 에이전트, 법률 에이전트, HLE-Verified 평가에서도 3.7 Flash 대비 향상을 보고했습니다.
- 어려운 문제에는 더 많은 추론을 사용. 모델은 한 번에 답을 내기보다 추가 추론 단계를 실행하고 도구를 반복 호출하며 결과를 점검할 수 있습니다. 높은 effort 설정은 복잡한 작업의 성능을 높일 수 있지만 토큰 사용량과 비용을 늘릴 수 있습니다. 효율을 우선하는 개발자는 effort를 낮추거나 3.7 Flash를 계속 사용할 수 있습니다.
- Flash 가격대 유지. 소개 가격은 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러입니다. Gemini API, Google AI Studio, Android Studio 등을 통해 사용할 수 있습니다.
- Cyber 버전은 방어에 집중. Gemini 3.8 Flash Cyber는 취약점 탐지와 자동 패치에 특화됐습니다. Google에 따르면 CyberGym에서 프런티어 수준의 결과를 기록했고, 20개 프로그래밍 언어를 포함한 내부 평가에서는 성공률이 70%를 넘었습니다. CWE-Bench의 pass@1 점수는 47.2%였습니다.
- 안전성과 접근 통제 강화. Google은 사이버 악용뿐 아니라 화학·생물·방사성·핵 관련 위험에 대한 보호책을 설명했습니다. Cyber 버전은 더 폭넓은 보안 기능을 제공하기 때문에 Fairwind Program을 통해 신뢰할 수 있는 방어자에게만 제한적으로 제공됩니다.
의미와 영향
이번 발표의 핵심은 단일 응답의 품질보다 계획 수립, 도구 사용, 중간 결과 확인, 재수정을 반복하는 에이전트 루프에 있습니다. 이런 방식은 코드베이스 유지보수와 연구형 분석에 적합하지만, 신뢰성과 완성도를 높이는 과정에서 지연 시간과 토큰 비용이 증가할 수 있습니다. 실제 도입에서는 정확도, 처리 시간, 비용 사이의 균형을 정하는 것이 중요합니다.
Cyber 버전은 고성능 보안 모델을 어디까지 공개할 것인지에 대한 현실적인 접근도 보여줍니다. 취약점 탐지와 패치 작성은 방어자의 대응 속도를 높일 수 있지만 공격에 전용될 위험도 있습니다. Fairwind Program을 통한 제한 배포는 이런 위험을 접근 관리 단계에서 줄이려는 선택입니다. 다만 공개된 수치와 사례는 Google이 제시한 자료이므로, 다양한 코드베이스와 독립 평가를 통한 추가 검증이 필요합니다.
출처: Google DeepMind
댓글
로그인 상태 확인 중…
댓글 불러오는 중…