아티클 목록으로
AI 에이전트

Meta, 로컬 AI 에이전트용 30B 모델 ‘Muse Glimmer’ 공개

약 3분 소요

들어가며

AI 에이전트는 대체로 클라우드 API에 의존하지만, 민감한 데이터의 외부 전송, 네트워크 지연, 반복적인 API 비용은 도입을 어렵게 만드는 요소입니다. Meta AI Research가 발표한 Muse Glimmer는 이런 문제에 대해 로컬 실행을 하나의 대안으로 제시합니다. Apache 2.0 라이선스로 공개된 300억 파라미터 오픈 웨이트 모델로, 로컬 코딩, 복잡한 도구 호출, 시각 정보 처리, 장시간 작업 흐름 실행을 주요 목표로 합니다.

핵심 내용

  • 에이전트 실행에 초점: 복잡한 추론 과정, 텍스트와 이미지가 교차하는 긴 시퀀스, 다단계 도구 호출 기록을 활용해 학습했습니다. 후속 학습에서는 지도 미세조정, 온폴리시 증류, 강화학습을 결합해 코드 생성, 구조화된 계획, 도구 사용을 개선했습니다.
  • 이미지 입력 지원: 18억 파라미터의 전용 인식 인코더를 통해 텍스트와 이미지가 섞인 입력을 처리합니다. 따라서 로컬 에이전트가 자동화 작업 중 스크린샷, 차트, 문서를 직접 읽는 구성이 가능합니다.
  • 양자화로 메모리 부담 완화: 압축하지 않은 30B 모델은 일반적으로 55GB가 넘는 VRAM을 요구합니다. Muse Glimmer는 4비트 동적 양자화를 사용해 가중치 용량을 약 17~20GB로 낮춥니다. 다만 KV 캐시, 시각 임베딩, 추측 디코딩용 모델을 위한 추가 메모리는 여전히 필요합니다.
  • 추측 디코딩 적용: DFlash 기반의 소형 초안 모델이 여러 토큰을 묶어 제안하고, 주 모델이 이를 병렬로 검증합니다. Meta는 M4/M5 Max와 NVIDIA RTX 5090 같은 하드웨어에서 생성 처리량이 최대 3.1배 높아질 수 있다고 설명합니다.
  • 오류 복구를 고려한 설계: API 호출이나 터미널 명령이 실패하면 즉시 중단하는 대신 오류를 진단하고 다른 경로를 시도하도록 학습됐습니다. 추론 강도를 조절할 수 있으며, OpenClaw, llama.cpp, ExecuTorch, Apple MLX, Ollama, LM Studio, vLLM 등과의 실행 지원도 제공합니다.

성능과 한계

Meta는 Muse Glimmer가 SWE-Bench, DeepSearch QA, τ-Bench, MCP-Atlas에서 비슷한 규모의 오픈 모델과 비교해 높은 성공률을 기록했다고 밝혔습니다. 특히 다단계 도구 호출의 신뢰성과 실패 상황에서의 복구 능력을 강조합니다. 그러나 제공된 자료에는 구체적인 점수가 포함되지 않았으므로, 이 비교를 종합적인 순위나 성능 확정으로 해석하기는 어렵습니다.

하드웨어 조건도 살펴볼 필요가 있습니다. 양자화된 가중치가 1720GB라고 해서 시스템 전체에 같은 용량만 필요한 것은 아닙니다. 긴 에이전트 세션에서는 인식 인코더, 초안 모델, KV 캐시가 추가 메모리를 사용합니다. Meta는 M4/M5 Max Mac이나 RTX 4090, RTX 5090을 탑재한 PC처럼 2432GB의 통합 메모리 또는 VRAM을 갖춘 시스템을 권장합니다.

의미와 영향

Muse Glimmer의 핵심은 비전, 코딩, 도구 사용, 오류 처리를 로컬 실행을 전제로 하나의 에이전트 모델에 결합했다는 점입니다. 소스 코드, 사내 문서, 데스크톱 자동화를 다루는 조직은 데이터 외부 전송과 클라우드 API 의존도를 줄일 가능성이 있습니다. 오픈 웨이트와 여러 추론 프레임워크 지원은 개발자의 실험과 맞춤형 배포에도 유리합니다.

다만 실제 체감 성능은 메모리 여유, 컨텍스트 길이, 연결된 도구의 품질, 작업 흐름 설계에 따라 달라집니다. Muse Glimmer는 양자화와 추측 디코딩으로 30B급 모델을 고성능 소비자용 하드웨어에 적용하려는 중요한 시도입니다. 그렇다고 모든 복잡한 작업에서 클라우드 에이전트 수준의 안정성을 보장한다는 뜻은 아닙니다.

출처: InfoQ 中文

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로
AI 에이전트
cctest.ai
AI 에이전트

PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로

PolicyGuide는 조직 정책을 워크플로 그래프로 변환하고 사용자 발화가 끝날 때마다 에이전트의 상태를 선제적으로 검증한다. 위험한 행동만 막는 대신 누락된 절차를 찾아 정책에 맞는 다음 단계로 안내하는 접근법이다.

더 보기
CCTest · Blog
Nvidia 연구가 보여준 것: AI 에이전트의 진짜 주역은 모델보다 Harness
AI 에이전트
cctest.ai
AI 에이전트

Nvidia 연구가 보여준 것: AI 에이전트의 진짜 주역은 모델보다 Harness

Nvidia 연구진은 모델 자체를 바꾸지 않고도 주변 소프트웨어 계층을 조정해 장기 과제 성능을 크게 높였습니다. 기억 관리, 도구 사용, 감독 에이전트가 에이전트 시스템의 핵심 요소로 떠오르고 있습니다.

더 보기