아티클 목록으로
모델 릴리스

Grok 4.7 공개: 장시간 코딩과 안전성에 초점

약 3분 소요

개요

xAI가 코딩과 지식 업무용 신모델 Grok 4.7을 발표했다. 이번 출시에서 강조하는 부분은 짧은 질문에 대한 답변 품질만이 아니다. 수시간이 걸릴 수 있는 복잡한 작업을 계속 수행하고, 긴 컨텍스트를 유지하며, 자신의 결과를 다시 확인하는 능력이 핵심이다.

다만 이번 자료는 xAI가 직접 작성한 제품 발표문이다. 아래에 언급되는 벤치마크와 경쟁 모델 비교, 안전성 주장은 독립 평가가 아니므로 평가 조건과 방법론을 함께 살펴볼 필요가 있다.

핵심 내용

  • 장시간 작업을 겨냥한 학습. xAI에 따르면 Grok 4.7은 Grok 4.6보다 큰 기반 모델을 사용하고 더 긴 강화학습을 거쳤다. 수시간이 필요한 문제에 더 높은 비중을 두어 계획 수립, 지속 실행, 결과 검증 능력을 개선했다는 설명이다.
  • 코딩과 지식 업무의 결합. 발표문은 CursorBench 4.0, DeepSWE, 전기공학, 사무 업무 평가에서 이전 모델보다 향상됐다고 주장한다. 고노력 설정의 DeepSWE 점수는 71%로 제시됐다. 또한 Grok Bot 실행 환경을 기본적으로 이해하도록 학습해 대화와 일반 지식 업무에도 대응하도록 했다고 설명한다.
  • 낮은 토큰 가격을 강조. API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러부터다. 출력 속도를 약 두 배로 높인 빠른 버전은 두 배 가격으로 제공된다. Grok Build와 Cursor, API, 코딩 하네스, 모델 라우터, 클라우드 플랫폼을 통한 사용이 안내돼 있다.
  • 안전성도 주요 메시지. xAI는 새로운 보호 체계를 적용해 거부 성능, 탈옥 저항, 생물안전성, 사이버 보안 평가에서 강한 결과를 얻었다고 밝혔다. 위험한 프롬프트의 허용률이 3.3%라는 수치도 제시했지만, 이 수치는 테스트 분류와 평가 설계에 따라 달라질 수 있다.

의미와 영향

Grok 4.7의 방향은 단순한 챗봇이나 코드 자동완성기를 넘어, 계획하고 실행한 뒤 결과를 확인하는 에이전트의 기반 모델이 되는 것이다. 토큰 가격이 낮다면 개발자는 여러 차례의 에이전트 실행과 실험을 더 쉽게 시도할 수 있다. 그러나 실제 도입에서는 특정 벤치마크보다 실제 코드 저장소에서의 성공률, 도구 호출 안정성, 지연시간, 컨텍스트 관리, 과도한 거부 여부가 더 중요하다.

공개된 표를 보면 Grok 4.7이 모든 영역에서 선두인 것은 아니다. 터미널 작업이나 임상 추론처럼 다른 모델이 더 높은 점수를 받은 항목도 있다. 따라서 발표문만으로 전반적인 우위를 판단하기보다는 조직의 실제 업무와 데이터로 소규모 검증을 진행해야 한다. 제3자 재현 평가도 필요하다.

결국 Grok 4.7은 장시간 작업 능력과 가격 경쟁력을 결합하려는 xAI의 전략으로 볼 수 있다. 이 조합이 실제 운영 환경에서 안정적인 에이전트 성능으로 이어질지는 향후 사용 사례와 독립 평가가 결정할 것이다.

출처: Hacker News

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
전 OpenAI 연구자, 소프트웨어 구조화 의사결정 모델 Jev 공개
모델 릴리스
cctest.ai
모델 릴리스

전 OpenAI 연구자, 소프트웨어 구조화 의사결정 모델 Jev 공개

TypeSafe AI가 첫 번째 ‘System One Model’로 소개한 Jev를 공개하고 얼리 액세스를 시작했다. 대화 자체보다 비구조화된 상태를 소프트웨어가 처리할 수 있는 빠르고 구조화된 결정으로 변환하는 데 초점을 맞춘다.

더 보기
CCTest · Blog
텍스트 대신 판단을 내리는 AI 모델 Jev가 주목받는 이유
모델 릴리스
cctest.ai
모델 릴리스

텍스트 대신 판단을 내리는 AI 모델 Jev가 주목받는 이유

OpenAI 출신 연구자 디오고 알메이다가 공동 설립한 TypeSafe AI가 텍스트가 아닌 확률 기반 결정을 출력하는 모델 Jev를 공개했다. 개발자들은 분류와 모델 라우팅, 소프트웨어 안전 점검에서 더 빠르고 저렴한 대안으로 시험하고 있다.

더 보기
CCTest · Blog
LimiX-2, 표 형식 데이터 학습을 예측에서 메커니즘 모델링으로
모델 릴리스
cctest.ai
모델 릴리스

LimiX-2, 표 형식 데이터 학습을 예측에서 메커니즘 모델링으로

LimiX-2는 특정 타깃 열만 예측하는 대신 변수들의 결합 구조를 학습하는 Contextual Mechanism Networks를 제안합니다. TabArena, TALENT, BCCO에서 선도적인 성능을 보고했으며 인과 골격 복원도 지원 대상으로 제시합니다.

더 보기