mixtureofexperts (2) 썸네일형 리스트형 Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실 Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실Qwen3.8 로컬 실행 썸네일Unsloth가 Qwen3.8-2.4T-A95B를 397GB까지 줄인 GGUF와 실행 가이드를 공개했어요. 4.9TB에 이르는 BF16 모델보다 91% 작지만, 일반 노트북에서 가볍게 돌리는 모델은 아니에요. 수백 GB 메모리를 갖춘 워크스테이션에서 초대형 MoE 모델을 직접 운영할 길을 연 사례에 가까워요. 1핵심 요약구분공개된 내용실제 의미모델 구조전체 2.4조 파라미터, 토큰당 950억 파라미터 활성화모든 가중치를 매번 계산하지 않는 MoE 모델이에요저장·메모리 규모BF16 4.9TB, Dynamic 1-bit XXXS 397GB91% 줄었어도 고사양 워크스테이션이 필요해요중간 선택지1-bit .. Kimi K3 2.78조 모델을 64GB 맥북에서 돌린 WASTE Kimi K3 2.78조 모델을 64GB 맥북에서 돌린 WASTEKimi K3 로컬 추론 썸네일2.78조 파라미터 규모의 Kimi K3를 64GB MacBook Pro에서 실행한 오픈소스 프로젝트가 나왔어요. WASTE는 모델 전체를 메모리에 올리는 대신, 토큰 생성에 필요한 전문가 가중치만 NVMe에서 읽어요. 속도는 빠르지 않지만 초대형 MoE 모델을 개인용 하드웨어에서 구동하는 방법을 구체적인 수치로 보여줘요. 1핵심 요약구분내용실제 의미모델Kimi K3 2.78조 파라미터 전체 모델증류하거나 가지치기한 축소판이 아니에요저장공간변환된 컨테이너 982GiB내부 NVMe에 약 1TB 여유 공간이 필요해요메모리4K 컨텍스트 최소 29.05GiB, 권장 구성 64GB최소치로 열 수는 있어도 운영체제 페이징.. 이전 1 다음