8GB 맥에서 26B 모델을 돌린 TurboFieldfare의 SSD 스트리밍 설계

26B급 언어 모델은 메모리가 작은 맥에서 실행하기 어렵다는 인식이 익숙해요. TurboFieldfare는 Gemma 4 26B-A4B의 가중치 전체를 메모리에 올리는 대신, 토큰 생성에 필요한 부분만 SSD에서 읽어 이 제약을 피했어요. 개발자가 공개한 측정값에 따르면 8GB M2 MacBook Air에서도 초당 5.1~6.3토큰으로 텍스트를 생성해요. 1
핵심 요약
| 구분 | 핵심 | 확인할 점 |
| 메모리 | 약 14.3GB 모델 가운데 공유 코어와 KV 캐시 등 약 2GB만 메모리에 둬요 | 모델 파일을 저장할 약 15GB 공간은 따로 필요해요 |
| 실행 구조 | 토큰마다 선택된 MoE 전문가 가중치를 SSD에서 읽어요 | 속도는 SSD와 페이지 캐시 상태에 영향을 받아요 |
| 성능 | 8GB M2 MacBook Air에서 5.1~6.3 tok/s를 기록했어요 | 수치는 입력 길이와 생성 설정에 따라 달라져요 |
| 지원 환경 | Swift 6.2와 Metal 4로 만든 Apple Silicon 전용 런타임이에요 | macOS 26 이상, 텍스트 전용 추론으로 범위가 좁아요 |
1. 14.3GB 모델을 약 2GB 메모리로 실행해요
TurboFieldfare는 Gemma 4 26B-A4B에 맞춰 새로 만든 Swift·Metal 런타임이에요. MLX나 llama.cpp 위에 얇은 기능을 얹은 구조가 아니에요. 약 1.35GB의 공유 코어와 FP16 KV 캐시는 메모리에 유지하고, MoE 라우터가 토큰마다 고른 전문가 가중치만 SSD에서 가져와요. 모델 파일은 약 14.3GB지만 실행 중 가중치와 4K KV 캐시가 쓰는 메모리를 약 2GB로 줄였다는 설명이에요. 2
Gemma 4 26B-A4B는 전체 26B 파라미터를 매번 계산하지 않아요. 토큰 하나를 만들 때 약 3.88B 파라미터만 활성화해요. TurboFieldfare는 이 MoE 특성을 저장 장치 계층까지 활용했어요. 현재 레이어에 필요한 전문가만 읽고, 이미 읽은 가중치는 레이어별 16슬롯 LFU 캐시에 남겨 같은 전문가를 다시 찾을 때 SSD 접근을 줄여요.
CPU가 병렬 `pread`로 캐시 미스를 채우는 동안 Metal은 메모리에 상주한 공유 전문가 계산을 먼저 처리해요. 입력 처리 단계에서는 최대 128토큰을 한 묶음으로 계산해 한 번 읽은 전문가 가중치를 여러 행에 재사용해요. 메모리 절약만 노리고 입출력을 무작정 늘린 방식보다 계산과 SSD 읽기를 겹치는 데 초점을 맞췄어요.
공개 측정치는 하드웨어 차이를 분명히 보여줘요. 8GB M2 MacBook Air에서는 5.1~6.3 tok/s, 24GB M5 Pro에서는 31~35 tok/s를 기록했어요. 짧은 대화를 로컬에서 처리하는 용도라면 8GB 기기의 수치도 실험해 볼 만해요. 다만 개발자는 입력 길이, 생성 길이, 페이지 캐시 상태에 따라 처리량이 달라진다고 밝혔어요. 같은 기기에서도 항상 같은 속도가 나온다는 보장은 없어요.
설치 과정도 메모리 사용을 줄이도록 짰어요. 고정된 모델 버전에서 필요한 바이트 범위를 내려받아 `.gturbo` 형식으로 바로 다시 배치해요. 원본 체크포인트 전체를 임시 메모리나 별도 파일로 만들지 않아요. 중단된 다운로드 재개와 파일 해시 확인도 지원해요.
사용 방식은 네이티브 맥 앱과 CLI로 나뉘어요. 실험적인 OpenAI 호환 Chat Completions 서버도 제공해 기존 로컬 도구와 연결할 여지가 있어요. 서버에는 원격 인증과 TLS가 없어서 `127.0.0.1` 안에서만 써야 해요. 앱, CLI, 서버가 같은 모델 디렉터리를 공유하지만 모델을 사용하는 프로세스는 한 번에 하나만 실행해야 해요.
지원 범위는 아직 좁아요. Apple Silicon Mac과 macOS 26, Metal 4, Swift 6.2 이상이 필요해요. 입력과 출력은 텍스트만 다루며 이미지·음성·영상은 지원하지 않아요. 특정 Gemma 모델에 맞춘 런타임이라 다른 모델을 폭넓게 실행하는 범용 엔진과도 성격이 달라요.
왜 중요한가요
로컬 LLM의 진입 장벽은 모델 파일 크기만이 아니라 실행 중 필요한 통합 메모리였어요. TurboFieldfare는 MoE 모델에서 매 순간 쓰지 않는 전문가 가중치를 SSD로 내보내 저용량 맥에서도 큰 모델을 실행할 수 있다는 구현 사례를 보여줘요. 개발자는 비슷한 구조를 검토할 때 모델의 활성 파라미터 비율, SSD 대역폭, 캐시 적중률을 함께 봐야 해요. 2
대신 2GB라는 숫자를 일반적인 26B 모델 전체에 적용하면 안 돼요. 이 결과는 희소 MoE 구조인 Gemma 4 26B-A4B, Apple Silicon, 전용 Swift·Metal 코드가 맞물린 사례예요. SSD 읽기가 늘면 속도와 저장 장치 사용량도 함께 살펴야 해요. 실제 도입 전에는 같은 기기에서 원하는 입력 길이와 생성 길이로 직접 속도를 재는 편이 안전해요.
참고 자료
'IT & AI' 카테고리의 다른 글
| Keychron ZGM 공개, 게이밍 마우스도 펌웨어를 직접 고칠 수 있을까요 (0) | 2026.07.31 |
|---|---|
| React 터미널 UI를 조립하는 termcn, 99개 컴포넌트를 한 번에 (0) | 2026.07.31 |
| tmux 다음을 노리는 Superlogical, 기기와 환경을 잇는 터미널 세션 (0) | 2026.07.30 |
| 채용 현장에서 통하는 디자이너 커리어 전략 (0) | 2026.07.30 |
| AI 스타트업이 풀스택보다 먼저 찾아야 할 통제 지점 (1) | 2026.07.30 |