본문 바로가기

IT & AI

27B 모델을 3.9GB에 담은 Bonsai 27B, 휴대폰 로컬 AI의 새 실험

728x90

27B 모델을 3.9GB에 담은 Bonsai 27B, 휴대폰 로컬 AI의 새 실험

AI 뉴스 썸네일
AI 뉴스 썸네일

27B급 언어 모델은 보통 휴대폰 메모리 안에 넣기 어려워요. PrismML은 Qwen3.6 27B를 저비트 가중치로 다시 구성한 Bonsai 27B를 공개했어요. 회사가 제시한 가장 작은 모델의 가중치 용량은 3.9GB예요. 아이폰에서 추론과 도구 호출, 비전 작업을 함께 처리하는 온디바이스 에이전트를 겨냥했어요. 1

핵심 요약

구분공개된 내용확인할 점
모델 크기삼진 모델은 5.9GB, 1비트 모델은 3.9GB예요앱이 쓸 수 있는 메모리에는 KV 캐시와 활성값도 함께 들어가요
성능회사의 15개 벤치마크 종합 점수는 삼진 80.5점, 1비트 76.1점이에요완전 정밀도 기준점 85.0과 비교한 자체 평가 결과예요
기능추론, 구조화된 도구 호출, 비전, 컴퓨터 사용을 지원해요휴대폰 시연은 캐시와 미리 입력한 이미지 문맥을 사용했어요
실행 환경Apple 기기는 MLX, NVIDIA GPU는 CUDA를 사용해요전용 저비트 커널과 호환 런타임이 필요해요

1. 27B 모델을 휴대폰 메모리 안으로 줄였어요

일반적인 27B 모델은 16비트 정밀도에서 약 54GB를 차지해요. 4비트로 줄여도 PrismML이 비교한 빌드는 약 18GB예요. Bonsai 27B는 언어 네트워크 전체에 낮은 비트 표현을 적용해 이 크기를 더 줄였어요. 임베딩, 어텐션, MLP, LM 헤드까지 같은 방향으로 압축했다는 설명이에요. 2

품질을 우선한 Ternary 모델은 `-1`, `0`, `+1`의 삼진 가중치와 그룹별 FP16 스케일을 사용해요. 실효 비트 수는 가중치당 1.71비트이고 파일 크기는 5.9GB예요. 더 작은 1-bit 모델은 `-1`, `+1`의 이진 가중치를 써서 가중치당 1.125비트, 3.9GB까지 낮췄어요.

728x90

휴대폰에서는 모델 파일만 들어간다고 실행할 수 있는 건 아니에요. PrismML은 12GB 메모리를 갖춘 아이폰에서도 앱이 실제로 쓸 수 있는 범위를 약 6GB로 설명해요. 이 공간에는 가중치뿐 아니라 KV 캐시와 연산 중 생기는 활성값도 들어가요. 3.9GB 모델은 이 부가 메모리를 위한 여유를 남기는 데 초점을 맞췄어요.

성능 감소는 작업마다 달라요

PrismML이 사고 모드로 측정한 15개 벤치마크에서 완전 정밀도 Qwen3.6 27B는 85.0점을 받았어요. Ternary Bonsai 27B는 80.5점, 1-bit Bonsai 27B는 76.1점을 기록했어요. 회사는 이를 기준 성능의 95%와 90%라고 설명해요. 자세한 항목과 평가 방식은 백서에 실려 있어요. 3

평균 점수만 보면 압축 효율이 커 보여요. 세부 결과에는 차이가 있어요. 1-bit 모델의 수학 점수는 91.7로 기준 모델의 95.3에 가까웠어요. 도구 호출·에이전트 항목은 80.0에서 66.0으로, 비전은 72.6에서 59.6으로 내려갔어요. 휴대폰 비서나 화면 조작 도구를 만들 때는 종합 점수보다 실제로 사용할 기능의 세부 점수를 먼저 봐야 해요.

로컬 에이전트는 비용과 데이터 경로가 달라져요

에이전트가 한 작업에서 모델을 수십 번이나 수백 번 부르면 API 비용과 네트워크 왕복이 계속 쌓여요. 로컬 모델은 반복 호출에 별도 토큰 요금이 들지 않아요. 문서, 화면, 중간 결과를 외부 서버로 보내지 않고 처리할 수도 있어요.

모든 단계를 휴대폰에 맡길 필요는 없어요. 개인정보가 포함된 분류와 요약은 로컬에서 처리하고, 높은 정확도가 필요한 일부 단계만 클라우드 모델로 보내는 구성이 가능해요. Bonsai 27B가 제품에 안착한다면 이런 혼합 구조에서 쓸 수 있는 로컬 모델의 작업 범위가 넓어져요.

바로 쓸 수 있는 범용 모델인지는 더 확인해야 해요

공개 수치는 PrismML이 자체 모델과 실행 환경에서 측정한 결과예요. RTX 5090에서는 1-bit 모델이 최대 163토큰/초, M5 Max에서는 최대 87토큰/초를 기록했다고 밝혔어요. 휴대폰의 실제 생성 속도와 전력 소비, 발열, 긴 문맥에서의 KV 캐시 사용량은 같은 조건의 독립 평가가 더 필요해요.

아이폰 멀티모달 시연도 캐시와 미리 입력한 이미지 문맥을 사용한 데모 모드예요. 실시간 카메라 입력이나 긴 에이전트 작업이 같은 체감 속도로 이어진다고 단정하기 어려워요. 모델은 Apache 2.0 라이선스로 공개되지만, Apple 기기에서는 MLX용 구현과 전용 저비트 커널이 필요해요. 기존 앱과 추론 도구가 곧바로 이 형식을 읽을 수 있는지도 배포 전에 확인해야 해요.

왜 중요한가요

Bonsai 27B의 숫자가 실제 기기에서도 재현되면 로컬 AI의 선택 기준이 달라져요. 지금까지 휴대폰용 모델은 작은 매개변수 수와 낮은 성능을 감수하는 경우가 많았어요. 이번 접근은 27B 모델의 일부 능력을 유지한 채 가중치 표현을 크게 줄였어요. 개발자는 모델 크기뿐 아니라 기능별 성능, KV 캐시, 런타임 지원을 함께 비교할 수 있어요. 2

당장 확인할 부분도 분명해요. 도구 호출과 비전 점수는 수학·코딩보다 더 많이 낮아졌어요. 휴대폰 에이전트의 핵심 기능이 이 두 영역이라면 3.9GB라는 크기만으로 제품 적합성을 판단하기 어려워요. 실제 기기에서 속도, 배터리, 발열, 긴 작업의 안정성을 재현한 결과가 나와야 활용 범위를 정확히 가늠할 수 있어요.

참고 자료

  1. Bonsai 27B - 휴대폰에서 실행되는 27B급 모델 — GeekNews
  2. Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone — PrismML
  3. Bonsai 27B Whitepaper — PrismML
728x90