20GB 안으로 들어온 30B 코딩 모델, Meta Muse Glimmer

Meta가 30B 파라미터 로컬 코딩 모델 Muse Glimmer를 공개했어요. 약 4비트로 양자화한 모델은 20GB보다 작아서 24GB나 32GB 메모리를 갖춘 Mac·PC에서 에이전트 작업을 돌리는 구성을 겨냥해요. 1
핵심 요약
| 구분 | 핵심 | 왜 볼 만한가요 |
| 공개 방식 | 30B 모델 가중치를 Apache 2.0 라이선스로 공개했어요 | 사용 조건이 비교적 명확한 오픈 웨이트 코딩 모델 선택지가 늘었어요 |
| 로컬 실행 | 약 4비트 양자화로 모델 크기를 20GB 미만으로 줄였어요 | 24GB·32GB급 소비자 하드웨어에서 로컬 에이전트를 구성할 수 있어요 |
| 작업 범위 | 함수 호출, 코드 작성·디버깅, 도구 오류 복구, 이미지 입력을 다뤄요 | 단순 코드 완성보다 긴 작업을 이어 가는 용도에 초점을 맞췄어요 |
| 속도 | DFlash 초안 모델을 이용해 여러 토큰을 먼저 제안해요 | 긴 추론과 반복 도구 호출에서 생기는 대기 시간을 줄이려는 방식이에요 |
1. 로컬 코딩 에이전트를 위해 30B 모델을 압축했어요
Muse Glimmer는 Meta Superintelligence Labs가 만든 297억 개 규모의 모델이에요. Hugging Face에 공개된 모델 정보에는 Apache 2.0 라이선스와 이미지·텍스트 입력 지원이 명시돼 있어요. 가중치 파일도 내려받을 수 있어요. 그래서 이 모델은 소스 코드 전체가 공개됐다는 뜻의 오픈소스보다, 가중치를 허용적인 라이선스로 배포한 오픈 웨이트 모델이라고 부르는 편이 정확해요. 2
Meta는 완전 정밀도 모델에 55GB가 넘는 메모리가 필요하다고 설명해요. 약 4비트 양자화를 적용한 언어 모델은 20GB보다 작아요. 남은 메모리는 KV 캐시와 이미지 인코더, DFlash 초안 모델에 쓸 수 있어요. 공식 설명이 제시한 실행 범위는 24GB 또는 32GB 메모리예요. 다만 운영체제와 문맥 길이, 이미지 입력 여부에 따라 실제 여유 메모리는 달라져요. 2
학습 과정에는 로짓 증류, 장문맥 중심의 중간 학습, 지도 미세조정, 온정책 증류, 강화학습이 쓰였어요. 더 큰 교사 모델의 작업 방식을 30B 모델로 옮기고, 제한된 로컬 연산 환경에서도 도구를 여러 번 호출하도록 만든 구성이에요. 100개가 넘는 언어의 데이터도 학습에 포함됐어요. 2
코드 생성보다 긴 작업을 겨냥해요
Muse Glimmer는 함수 스키마에 맞춰 도구를 호출하고, 호출이 실패하면 원인을 살핀 뒤 다시 시도하도록 훈련됐어요. 코드 작성과 디버깅 외에도 스크린샷, 차트, 문서를 대화와 함께 처리해요. Meta는 DeepSearch QA, MCP-Atlas, τ-Bench, SWE-Bench로 전체 작업 수행 능력을 평가했다고 밝혔어요. 이 수치는 제품 소개 자료에 나온 자체 평가이므로 실제 저장소와 개발 환경에서도 같은 결과가 나오는지는 따로 확인할 필요가 있어요. 2
DFlash가 토큰 생성 대기 시간을 줄여요
일반적인 언어 모델은 토큰을 하나씩 만들어요. Muse Glimmer는 작은 DFlash 초안 모델이 토큰 블록을 먼저 제안하고, 본 모델이 여러 제안을 병렬로 확인해요. Meta가 공개한 측정에서는 K-Quant-17GB 모델과 양자화 초안 모델을 함께 썼을 때 디코딩 속도가 RTX 5090에서 3.1배, M5 Max에서 1.8배, M4 Max에서 1.5배 빨라졌어요. 하드웨어와 설정을 고정한 공식 측정치이므로 다른 기기의 속도로 그대로 받아들이면 안 돼요. 2
현재 모델 페이지에는 Transformers용 가중치와 설정 파일이 올라와 있어요. llama.cpp, MLX, ExecuTorch 최적화와 Ollama, LM Studio, Unsloth 지원은 공개 후 며칠 안에 추가할 계획이라고 Meta가 안내했어요. 지금 바로 설치하려면 각 도구의 지원 상태를 먼저 확인하는 편이 안전해요. 3
왜 중요한가요
로컬 AI 코딩 도구는 코드와 문서를 외부 API로 보내지 않고 작업할 수 있어요. 네트워크가 끊긴 환경에서도 쓸 수 있고, 호출량에 따라 늘어나는 API 비용도 피할 수 있어요. Muse Glimmer는 30B급 모델을 24GB·32GB 메모리 구간에 맞추면서 함수 호출과 오류 복구까지 한 모델에 담았어요. 개인용 워크스테이션에서 장시간 코딩 작업을 맡기려는 개발자에게 비교해 볼 기준이 하나 더 생겼어요. 2
실용성은 메모리 점유율만으로 판단하기 어려워요. 긴 문맥을 넣었을 때의 속도, 실제 코드베이스에서의 수정 정확도, 도구 호출 형식의 호환성도 함께 봐야 해요. 공식 비교 대상은 Gemma4-31B와 Qwen3.6-27B이며, 소개 자료의 벤치마크만으로 더 최신 모델보다 낫다고 단정할 근거는 부족해요. llama.cpp와 MLX 같은 실행 도구의 최적화가 나온 뒤 실제 토큰 속도와 작업 성공률을 확인해야 선택이 쉬워져요. 3
참고 자료
- Meta Muse Glimmer - 기기에서 실행하는 오픈 웨이트 30B 코딩 모델 — GeekNews
- Introducing MuseGlimmer: An Open Agentic Model That Runs on Your Device — Meta AI Research
- Muse-Glimmer-30B 모델 카드 — Hugging Face
'IT & AI' 카테고리의 다른 글
| LLM 설명을 움직이는 학습 시뮬레이션으로 바꾸는 법 (0) | 2026.08.11 |
|---|---|
| Claude Code가 Auto mode를 기본값으로 바꾸는 이유 (0) | 2026.08.11 |
| AI 스타트업 ARR, 숫자보다 계산법을 봐야 해요 (0) | 2026.08.11 |
| 코드를 덜 써도 성과를 만드는 엔지니어링 리더의 하루 (0) | 2026.08.11 |
| AI 제품 가격, 월 구독만으로는 부족한 이유 (0) | 2026.08.11 |