Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실

Unsloth가 Qwen3.8-2.4T-A95B를 397GB까지 줄인 GGUF와 실행 가이드를 공개했어요. 4.9TB에 이르는 BF16 모델보다 91% 작지만, 일반 노트북에서 가볍게 돌리는 모델은 아니에요. 수백 GB 메모리를 갖춘 워크스테이션에서 초대형 MoE 모델을 직접 운영할 길을 연 사례에 가까워요. 1
핵심 요약
| 구분 | 공개된 내용 | 실제 의미 |
| 모델 구조 | 전체 2.4조 파라미터, 토큰당 950억 파라미터 활성화 | 모든 가중치를 매번 계산하지 않는 MoE 모델이에요 |
| 저장·메모리 규모 | BF16 4.9TB, Dynamic 1-bit XXXS 397GB | 91% 줄었어도 고사양 워크스테이션이 필요해요 |
| 중간 선택지 | 1-bit 표준 508GB, 2-bit 657GB, Q8_0 2.6TB | 용량과 출력 품질 사이에서 구성을 골라야 해요 |
| 실행 환경 | Unsloth Desktop, llama.cpp, RAM 오프로딩, 멀티 GPU | Mac·Windows·Linux에서 자체 API 서버로 연결할 수 있어요 |
| 주의점 | 신규 1-bit 형식의 Qwen3.8 벤치마크는 진행 중 | 용량 감소만 보고 품질이 유지된다고 단정하면 안 돼요 |
1. 4.9TB 모델을 397GB로 줄였지만 개인용 모델은 아니에요
Qwen3.8-2.4T-A95B는 전체 파라미터가 2.4조 개에 이르는 오픈 가중치 모델이에요. MoE 구조라 토큰 하나를 처리할 때는 950억 개를 활성화해요. 전체 모델을 매 토큰마다 계산하지는 않지만, 가중치 파일을 저장하고 필요한 부분을 불러올 메모리와 저장장치는 여전히 커야 해요. 2
Unsloth 문서에서 BF16 모델은 4.9TB를 차지해요. 가장 작은 Dynamic 1-bit XXXS는 397GB예요. 1-bit 표준은 508GB, Dynamic 2-bit는 657GB예요. 정밀도를 더 높인 Q8_0은 2.6TB예요. 단순히 1비트부터 8비트까지 한 줄로 비교하기보다, 각 형식이 차지하는 총 메모리와 허용할 품질 저하를 함께 봐야 해요.
397GB라는 숫자도 일반 PC 기준으로는 작지 않아요. 문서의 하드웨어 표는 RAM과 VRAM, 통합 메모리를 합친 총 메모리를 기준으로 삼아요. RAM 오프로딩과 멀티 GPU를 활용할 수 있지만, 디스크에 모델 파일만 저장해 두면 충분하다는 뜻은 아니에요. 메모리가 부족하면 일부 가중치를 RAM으로 넘기거나 여러 장의 GPU에 나눠야 하고, 그만큼 토큰 생성 속도도 하드웨어 구성에 크게 좌우돼요.
모든 레이어를 같은 비율로 줄이지 않아요
Unsloth Dynamic 양자화는 모델의 모든 레이어를 같은 정밀도로 낮추지 않아요. 오차에 민감한 레이어는 더 높은 정밀도를 남기고, 상대적으로 덜 민감한 부분을 더 강하게 줄이는 방식이에요. 이번 1-bit 계열에는 llama.cpp의 IQ1_S를 확장한 새 데이터 형식도 들어갔어요. 가장 작은 UD-IQ1_XXXS는 가중치당 1.1875비트를 사용해요. 코드북 항목 수를 줄여 파일 크기를 낮춘 구성이에요. 2
다만 가장 작은 파일이 항상 가장 좋은 선택은 아니에요. Unsloth는 새 데이터 형식이 다른 대형 모델에서 QAT나 양자화 인지 증류 없이도 작동했다고 설명해요. Qwen3.8에 대한 새 형식의 벤치마크는 아직 진행 중이라고 밝혔어요. 실제 도입 전에는 원본과 양자화 버전의 정확도, 지시 수행, 긴 문맥 처리, 생성 속도를 같은 작업으로 비교해야 해요.
로컬 API로 연결할 수 있어요
실행 경로는 한 가지가 아니에요. Unsloth Desktop은 Mac, Windows, Linux를 지원해요. llama.cpp를 이용한 실행법도 공식 문서에 담겼어요. GeekNews 요약에는 Ollama, LM Studio, vLLM, SGLang 같은 도구와 자체 API 서빙 경로도 소개돼 있어요. 로컬 API로 띄우면 코딩 도구나 에이전트의 모델 백엔드로 연결할 수 있어요. 1
이 구성이 맞는 대상은 데이터 외부 전송을 줄여야 하는 연구팀이나, 초대형 오픈 가중치 모델을 자체 장비에서 평가하려는 조직이에요. API 사용량이 많아 자체 운영 비용을 비교하려는 팀에도 검토할 이유가 있어요. 반면 개인 개발자가 데스크톱 한 대로 빠른 챗봇을 만들려는 목적에는 397GB 버전도 부담이 커요. Unsloth 문서는 별도로 예고된 Qwen3.8-27B가 16GB 이상의 VRAM 또는 RAM 환경에서 실행될 수 있다고 안내해요. 개인용 하드웨어라면 27B 모델이 더 현실적인 출발점이에요.
왜 중요한가요
초대형 오픈 가중치 모델의 자체 실행 범위가 데이터센터에서 고사양 워크스테이션으로 조금 넓어졌어요. 4.9TB 원본을 397GB로 줄이면 장비 선택지가 늘고, 모델을 외부 API에 보내지 않는 평가 환경도 꾸릴 수 있어요. 그렇다고 2.4조 파라미터 모델이 소비자용 PC 모델로 바뀐 것은 아니에요. 2
도입 판단에서는 파일 크기보다 전체 시스템을 봐야 해요. 필요한 RAM과 VRAM, GPU 간 분산 방식, 메모리 대역폭, RAM 오프로딩 비용, 실제 토큰 생성 속도를 함께 측정해야 해요. 1-bit 버전은 품질 검증도 남아 있어요. 민감한 업무라면 자체 프롬프트와 평가 데이터로 BF16 또는 더 높은 비트 버전과 결과를 비교한 뒤 선택하는 편이 안전해요.
이번 공개가 보여준 변화는 "거대한 모델을 작은 PC에서 돌린다"는 이야기가 아니에요. 모델 구조와 레이어별 민감도를 활용하면, 이전에는 저장과 메모리 규모 때문에 접근하기 어려웠던 모델도 자체 장비에서 시험할 수 있다는 점이에요. 개인 사용자는 27B처럼 작은 모델을 기다리는 편이 합리적이고, 조직은 397GB부터 2.6TB까지의 양자화 옵션을 비용과 품질 기준으로 나눠 검토할 수 있어요.
참고 자료
- Unsloth, Qwen3.8 2.4T를 397GB로 줄여 로컬 실행 지원 — GeekNews
- Qwen3.8 - How to Run Locally — Unsloth Documentation
'IT & AI' 카테고리의 다른 글
| 영상 타임라인에 Claude와 Codex가 들어왔어요, Palmier Pro (0) | 2026.08.14 |
|---|---|
| uBlock Origin이 Facebook 광고 대응을 멈춘 이유 (0) | 2026.08.13 |
| Delta는 코딩 에이전트의 작업 과정을 팀과 함께 검토해요 (0) | 2026.08.13 |
| AI 코딩을 멈춘 20년 차 개발자, 속도 뒤에서 잃은 것들 (0) | 2026.08.13 |
| 2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요 (0) | 2026.08.13 |