아티클 목록으로
모델 릴리스

Claude Opus 5 공개: 절반 가격으로 Fable 5에 근접

약 3분 소요

도입

Anthropic이 Claude Opus 5를 공식 출시했다. 가장 눈에 띄는 점은 Fable 5의 약 절반 가격으로 여러 핵심 평가에서 비슷하거나 더 나은 결과를 냈다는 점이다. 그러나 이번 발표의 의미를 단순한 가격 대비 성능으로만 보면 부족하다. 소재에 나온 개발자 실험과 공식 사례를 보면, Opus 5는 코드를 생성하는 데서 그치지 않고 검증 절차를 만들고, 결과가 목표에 맞는지 스스로 확인하는 방향으로 진화하고 있다.

핵심 포인트

  • 가격은 유지, 성능은 상승. Opus 5는 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 제공되며, Fable 5의 약 절반 가격으로 소개됐다. Frontier-Bench v0.1에서는 43.3%를 기록해 Fable 5의 33.7%, 이전 세대 Opus 4.8의 21.1%를 웃돌았다.
  • 복잡한 코드·시각화 작업에서 강한 인상. 개발자들은 Rocket League 스타일 게임, 스키 장면, Minecraft 복각, 1945년부터 2055년까지 변하는 거리의 단일 HTML 파일, 아폴로 발사 장면 등을 테스트했다. 평가는 주로 물리, 구조, 상호작용의 완성도에 집중됐다.
  • 자기 검증 능력이 두드러졌다. 보잉 747 브라우저 3D 재구성 테스트에서 Opus 5는 모델을 만드는 것뿐 아니라 측정 스크립트도 작성했다. 렌더링 이미지에서 정사영 윤곽을 추출하고, 날개폭·축간거리·주익 전연 후퇴각 등 14개 지표를 공개 데이터와 대조했다.
  • Claude Code의 시스템 프롬프트도 대폭 축소. Anthropic은 Opus 5와 Fable 5 세대에 맞춰 Claude Code의 시스템 프롬프트를 80% 이상 줄였지만 코딩 평가 점수는 떨어지지 않았다고 설명했다. 과거의 “기본적으로 주석을 쓰지 말라” 같은 고정 규칙은 주변 코드 스타일에 맞추라는 유연한 지침으로 바뀌었다.

의미와 영향

Opus 5가 보여주는 변화는 모델이 단순히 프롬프트를 따라 결과물을 내는 수준을 넘어, 목표를 달성하기 위한 과정을 조직하는 방향으로 가고 있다는 점이다. 모델이 도구 호출 시점, 기억 저장 여부, 테스트 환경 구축 필요성을 스스로 판단한다면 사람이 긴 시스템 프롬프트로 모든 행동을 규정할 필요는 줄어든다.

코딩 AI에서는 이 차이가 특히 중요하다. 앞으로의 경쟁은 멋진 웹 데모를 한 번에 만드는 능력뿐 아니라, 검증 공백을 찾아내고 테스트 루프를 만들며 결과의 신뢰성을 입증하는 능력으로 옮겨갈 가능성이 크다. Opus 5는 더 많은 독립 검증이 필요하지만, 이번 사례들은 모델 경쟁의 초점이 생성 능력에서 엔지니어링 자율성으로 확장되고 있음을 보여준다.

출처: 量子位

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
앤트 바이링, Agent 효율성 겨냥한 혼합 추론 모델 Ling-3.0-Flash 공개
모델 릴리스
cctest.ai
모델 릴리스

앤트 바이링, Agent 효율성 겨냥한 혼합 추론 모델 Ling-3.0-Flash 공개

앤트 바이링이 차세대 네이티브 혼합 추론 모델 Ling-3.0-Flash를 공개했다. 총 124B 파라미터 중 단일 계산에서 5.1B만 활성화하며, Agent 작업과 긴 문맥 처리, 낮은 추론 비용을 핵심 방향으로 내세운다.

더 보기