본문 바로가기

IT & AI

20GB 안으로 들어온 30B 코딩 모델, Meta Muse Glimmer

728x90

20GB 안으로 들어온 30B 코딩 모델, Meta Muse Glimmer

AI 뉴스 썸네일
AI 뉴스 썸네일
728x90

Meta가 30B 파라미터 로컬 코딩 모델 Muse Glimmer를 공개했어요. 약 4비트로 양자화한 모델은 20GB보다 작아서 24GB나 32GB 메모리를 갖춘 Mac·PC에서 에이전트 작업을 돌리는 구성을 겨냥해요. 1

핵심 요약

구분핵심왜 볼 만한가요
공개 방식30B 모델 가중치를 Apache 2.0 라이선스로 공개했어요사용 조건이 비교적 명확한 오픈 웨이트 코딩 모델 선택지가 늘었어요
로컬 실행약 4비트 양자화로 모델 크기를 20GB 미만으로 줄였어요24GB·32GB급 소비자 하드웨어에서 로컬 에이전트를 구성할 수 있어요
작업 범위함수 호출, 코드 작성·디버깅, 도구 오류 복구, 이미지 입력을 다뤄요단순 코드 완성보다 긴 작업을 이어 가는 용도에 초점을 맞췄어요
속도DFlash 초안 모델을 이용해 여러 토큰을 먼저 제안해요긴 추론과 반복 도구 호출에서 생기는 대기 시간을 줄이려는 방식이에요

1. 로컬 코딩 에이전트를 위해 30B 모델을 압축했어요

Muse Glimmer는 Meta Superintelligence Labs가 만든 297억 개 규모의 모델이에요. Hugging Face에 공개된 모델 정보에는 Apache 2.0 라이선스와 이미지·텍스트 입력 지원이 명시돼 있어요. 가중치 파일도 내려받을 수 있어요. 그래서 이 모델은 소스 코드 전체가 공개됐다는 뜻의 오픈소스보다, 가중치를 허용적인 라이선스로 배포한 오픈 웨이트 모델이라고 부르는 편이 정확해요. 2

Meta는 완전 정밀도 모델에 55GB가 넘는 메모리가 필요하다고 설명해요. 약 4비트 양자화를 적용한 언어 모델은 20GB보다 작아요. 남은 메모리는 KV 캐시와 이미지 인코더, DFlash 초안 모델에 쓸 수 있어요. 공식 설명이 제시한 실행 범위는 24GB 또는 32GB 메모리예요. 다만 운영체제와 문맥 길이, 이미지 입력 여부에 따라 실제 여유 메모리는 달라져요. 2

학습 과정에는 로짓 증류, 장문맥 중심의 중간 학습, 지도 미세조정, 온정책 증류, 강화학습이 쓰였어요. 더 큰 교사 모델의 작업 방식을 30B 모델로 옮기고, 제한된 로컬 연산 환경에서도 도구를 여러 번 호출하도록 만든 구성이에요. 100개가 넘는 언어의 데이터도 학습에 포함됐어요. 2

코드 생성보다 긴 작업을 겨냥해요

Muse Glimmer는 함수 스키마에 맞춰 도구를 호출하고, 호출이 실패하면 원인을 살핀 뒤 다시 시도하도록 훈련됐어요. 코드 작성과 디버깅 외에도 스크린샷, 차트, 문서를 대화와 함께 처리해요. Meta는 DeepSearch QA, MCP-Atlas, τ-Bench, SWE-Bench로 전체 작업 수행 능력을 평가했다고 밝혔어요. 이 수치는 제품 소개 자료에 나온 자체 평가이므로 실제 저장소와 개발 환경에서도 같은 결과가 나오는지는 따로 확인할 필요가 있어요. 2

DFlash가 토큰 생성 대기 시간을 줄여요

일반적인 언어 모델은 토큰을 하나씩 만들어요. Muse Glimmer는 작은 DFlash 초안 모델이 토큰 블록을 먼저 제안하고, 본 모델이 여러 제안을 병렬로 확인해요. Meta가 공개한 측정에서는 K-Quant-17GB 모델과 양자화 초안 모델을 함께 썼을 때 디코딩 속도가 RTX 5090에서 3.1배, M5 Max에서 1.8배, M4 Max에서 1.5배 빨라졌어요. 하드웨어와 설정을 고정한 공식 측정치이므로 다른 기기의 속도로 그대로 받아들이면 안 돼요. 2

현재 모델 페이지에는 Transformers용 가중치와 설정 파일이 올라와 있어요. llama.cpp, MLX, ExecuTorch 최적화와 Ollama, LM Studio, Unsloth 지원은 공개 후 며칠 안에 추가할 계획이라고 Meta가 안내했어요. 지금 바로 설치하려면 각 도구의 지원 상태를 먼저 확인하는 편이 안전해요. 3

왜 중요한가요

로컬 AI 코딩 도구는 코드와 문서를 외부 API로 보내지 않고 작업할 수 있어요. 네트워크가 끊긴 환경에서도 쓸 수 있고, 호출량에 따라 늘어나는 API 비용도 피할 수 있어요. Muse Glimmer는 30B급 모델을 24GB·32GB 메모리 구간에 맞추면서 함수 호출과 오류 복구까지 한 모델에 담았어요. 개인용 워크스테이션에서 장시간 코딩 작업을 맡기려는 개발자에게 비교해 볼 기준이 하나 더 생겼어요. 2

실용성은 메모리 점유율만으로 판단하기 어려워요. 긴 문맥을 넣었을 때의 속도, 실제 코드베이스에서의 수정 정확도, 도구 호출 형식의 호환성도 함께 봐야 해요. 공식 비교 대상은 Gemma4-31B와 Qwen3.6-27B이며, 소개 자료의 벤치마크만으로 더 최신 모델보다 낫다고 단정할 근거는 부족해요. llama.cpp와 MLX 같은 실행 도구의 최적화가 나온 뒤 실제 토큰 속도와 작업 성공률을 확인해야 선택이 쉬워져요. 3

참고 자료

  1. Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델 — GeekNews
  2. Introducing MuseGlimmer: An Open Agentic Model That Runs on Your Device — Meta AI Research
  3. Muse-Glimmer-30B 모델 카드 — Hugging Face
728x90