Grok 4.7 공개: 장시간 코딩과 안전성에 초점
개요
xAI가 코딩과 지식 업무용 신모델 Grok 4.7을 발표했다. 이번 출시에서 강조하는 부분은 짧은 질문에 대한 답변 품질만이 아니다. 수시간이 걸릴 수 있는 복잡한 작업을 계속 수행하고, 긴 컨텍스트를 유지하며, 자신의 결과를 다시 확인하는 능력이 핵심이다.
다만 이번 자료는 xAI가 직접 작성한 제품 발표문이다. 아래에 언급되는 벤치마크와 경쟁 모델 비교, 안전성 주장은 독립 평가가 아니므로 평가 조건과 방법론을 함께 살펴볼 필요가 있다.
핵심 내용
- 장시간 작업을 겨냥한 학습. xAI에 따르면 Grok 4.7은 Grok 4.6보다 큰 기반 모델을 사용하고 더 긴 강화학습을 거쳤다. 수시간이 필요한 문제에 더 높은 비중을 두어 계획 수립, 지속 실행, 결과 검증 능력을 개선했다는 설명이다.
- 코딩과 지식 업무의 결합. 발표문은 CursorBench 4.0, DeepSWE, 전기공학, 사무 업무 평가에서 이전 모델보다 향상됐다고 주장한다. 고노력 설정의 DeepSWE 점수는 71%로 제시됐다. 또한 Grok Bot 실행 환경을 기본적으로 이해하도록 학습해 대화와 일반 지식 업무에도 대응하도록 했다고 설명한다.
- 낮은 토큰 가격을 강조. API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러부터다. 출력 속도를 약 두 배로 높인 빠른 버전은 두 배 가격으로 제공된다. Grok Build와 Cursor, API, 코딩 하네스, 모델 라우터, 클라우드 플랫폼을 통한 사용이 안내돼 있다.
- 안전성도 주요 메시지. xAI는 새로운 보호 체계를 적용해 거부 성능, 탈옥 저항, 생물안전성, 사이버 보안 평가에서 강한 결과를 얻었다고 밝혔다. 위험한 프롬프트의 허용률이 3.3%라는 수치도 제시했지만, 이 수치는 테스트 분류와 평가 설계에 따라 달라질 수 있다.
의미와 영향
Grok 4.7의 방향은 단순한 챗봇이나 코드 자동완성기를 넘어, 계획하고 실행한 뒤 결과를 확인하는 에이전트의 기반 모델이 되는 것이다. 토큰 가격이 낮다면 개발자는 여러 차례의 에이전트 실행과 실험을 더 쉽게 시도할 수 있다. 그러나 실제 도입에서는 특정 벤치마크보다 실제 코드 저장소에서의 성공률, 도구 호출 안정성, 지연시간, 컨텍스트 관리, 과도한 거부 여부가 더 중요하다.
공개된 표를 보면 Grok 4.7이 모든 영역에서 선두인 것은 아니다. 터미널 작업이나 임상 추론처럼 다른 모델이 더 높은 점수를 받은 항목도 있다. 따라서 발표문만으로 전반적인 우위를 판단하기보다는 조직의 실제 업무와 데이터로 소규모 검증을 진행해야 한다. 제3자 재현 평가도 필요하다.
결국 Grok 4.7은 장시간 작업 능력과 가격 경쟁력을 결합하려는 xAI의 전략으로 볼 수 있다. 이 조합이 실제 운영 환경에서 안정적인 에이전트 성능으로 이어질지는 향후 사용 사례와 독립 평가가 결정할 것이다.
출처: Hacker News
댓글
로그인 상태 확인 중…
댓글 불러오는 중…