Qwen3.8-27B 4비트 로컬 실행, 24GB Mac이 현실적인 기준이에요

270억 파라미터 모델을 개인 장비에서 돌릴 때 가장 먼저 막히는 곳은 메모리예요. Unsloth가 공개한 Qwen3.8-27B 양자화 판은 4비트 기준으로 총 17~19GB 메모리를 요구해요. 24GB 통합 메모리를 갖춘 Mac이나 24GB급 GPU 데스크톱이라면 로컬 실행을 시험해 볼 수 있는 크기예요. 2
핵심 요약
| 구분 | 공개된 내용 | 실제로 확인할 점 |
| 모델 | 270억 파라미터 밀집형 모델이에요 | 비전과 추론을 함께 지원해요 |
| 4비트 메모리 | 총 17~19GB가 필요해요 | 24GB 장비가 실행 여유를 두기 좋아요 |
| 실행 형식 | GGUF와 NVFP4를 제공해요 | GPU 세대와 실행 도구에 맞춰 골라야 해요 |
| 문맥 길이 | 기본 262,144 토큰이에요 | YaRN으로 100만 토큰까지 늘릴 수 있어요 |
| 성능 자료 | 코딩과 장기 작업 점수가 이전 27B보다 올랐어요 | 공개 문서의 평가 조건을 함께 읽어야 해요 |
1. 17~19GB면 돌아가지만 24GB 장비가 더 현실적이에요
Unsloth의 하드웨어 표는 RAM과 VRAM, 통합 메모리를 합친 총 메모리를 기준으로 잡아요. Qwen3.8-27B는 2비트에서 11~13GB, 3비트에서 13~16GB, 4비트에서 17~19GB를 요구해요. 6비트는 24GB, 8비트는 31GB, BF16은 56GB가 기준이에요. 1
4비트 모델이 19GB 안에 들어간다고 해서 20GB 장비가 늘 편하게 작동하는 것은 아니에요. 실행 프로그램과 운영체제도 메모리를 쓰고, 긴 입력을 처리할수록 KV 캐시가 커져요. 이미지나 영상까지 넣으면 필요한 여유 공간이 더 늘 수 있어요. 그래서 24GB 통합 메모리 Mac이나 24GB VRAM GPU가 실사용에 가까운 출발점이에요.
GGUF와 NVFP4는 하드웨어에 맞춰 골라요
GGUF는 `llama.cpp` 계열 도구에서 널리 쓰여요. 기존 GPU나 CPU·RAM 오프로딩을 섞는 환경이라면 먼저 검토하기 좋아요. Unsloth Desktop은 macOS, Windows, Linux에서 모델 검색과 다운로드, 실행을 지원해요. RAM 오프로딩과 여러 GPU를 나눠 쓰는 구성도 다뤄요. 3
NVFP4는 NVIDIA Blackwell 계열을 겨냥한 선택지예요. Unsloth는 자사 측정에서 NVFP4가 BF16보다 약 1.5배 빠르고, top-1 정확도의 92~97%를 유지했다고 밝혔어요. 이 수치는 모든 작업에서 같은 속도와 품질을 보장한다는 뜻은 아니에요. RTX 50 계열처럼 NVFP4를 제대로 지원하는 GPU에서 같은 입력문과 출력 길이로 직접 비교하는 편이 안전해요. 2
긴 문맥은 메모리 비용도 함께 늘려요
기본 문맥 길이는 262,144 토큰이에요. YaRN을 설정하면 최대 100만 토큰까지 확장할 수 있어요. 모델이 긴 입력을 받을 수 있는 것과 개인 장비에서 그 길이를 빠르게 처리하는 것은 별개의 문제예요. 문맥을 늘리면 KV 캐시와 처리 시간이 함께 커져요.
로컬 코딩 도우미로 쓴다면 저장소 전체를 한 번에 넣기보다 필요한 파일과 작업 기록만 골라 보내는 방식이 더 현실적이에요. 비전 작업도 영상 프레임 수와 이미지 해상도를 먼저 제한해야 메모리 급증을 줄일 수 있어요. 최대 문맥 숫자보다 실제 작업 한 건의 입력 길이와 응답 속도를 먼저 재는 편이 좋아요.
코딩 점수는 올랐지만 자체 업무로 다시 확인해야 해요
Unsloth가 정리한 표에서 Qwen3.8-27B의 Terminal Bench 2.1 점수는 73.0이에요. 이전 Qwen3.6-27B의 63.4보다 9.6점 높아요. SWE-bench Pro는 53.5에서 61.7로 올랐고, LiveCodeBench v6는 83.9에서 90.3으로 높아졌어요. 장시간 사무 작업을 보는 CoWorkBench도 61.0에서 70.7로 올랐어요. 2
평가마다 실행 도구와 문맥 길이, 수정된 문제 구성이 달라요. 일부 비교 모델은 공식 점수가 아니라 같은 도구로 다시 측정한 값이에요. 코딩 도우미를 고를 때는 사용하는 언어와 저장소 규모, 테스트 통과율, 도구 호출 성공률을 같은 조건에서 비교해야 해요. 벤치마크 순위만으로 로컬 환경의 응답 속도와 안정성을 알 수는 없어요.
왜 중요한가요
Qwen3.8-27B 양자화 판은 최신 27B급 멀티모달 모델을 24GB 개인 장비에서 시험할 선택지를 줘요. 외부 API로 코드나 문서를 보내기 어려운 개발자도 로컬 코딩, 문서 분석, 이미지 이해 작업을 직접 구성할 수 있어요. 2
장비 선택에서는 모델 파일이 들어가는지만 보면 부족해요. 4비트 모델을 쓸 장비라면 운영체제와 KV 캐시를 위한 여유 메모리를 남겨야 해요. 긴 문맥이나 비전 입력을 자주 쓰면 24GB도 빠듯할 수 있어요. 먼저 짧은 문맥으로 토큰 생성 속도와 메모리 사용량을 재고, 필요한 경우 문맥 길이와 양자화 정밀도를 조절하는 순서가 안전해요.
가장 작은 IQ2_XXS는 약 9GB까지 줄어들지만 Unsloth 측 측정에서 원본 대비 top-1 정확도 유지율은 82.5%였어요. 메모리를 아끼는 대신 출력 품질 손실이 커질 수 있어요. 4비트가 모든 장비의 정답은 아니지만, 24GB급 개인 장비에서 품질과 메모리 사이를 맞추기 좋은 기준점이에요.
참고 자료
- Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능 — GeekNews
- Qwen3.8 - How to Run Locally — Unsloth Documentation
- Unsloth Desktop — Unsloth Documentation
'IT & AI' 카테고리의 다른 글
| GLM-5.3, 같은 기반 모델로 코딩과 보안 성능을 끌어올렸어요 (0) | 2026.08.15 |
|---|---|
| 노트 폴더를 AI와 함께 쓰는 오픈소스 앱, Hubble.md (0) | 2026.08.15 |
| Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요 (0) | 2026.08.15 |
| X가 For You 추천 점수와 노출 제한 경로를 더 공개했어요 (0) | 2026.08.14 |
| GPT-5.6 Sol Ultrafast, 초당 750 토큰이 바꾸는 대기 시간 (0) | 2026.08.14 |