카카오가 공개한 경량 언어모델 Kanana-2, 1.3B로 32K 문맥까지

카카오가 Kanana-2 SLM의 3B와 1.3B 모델을 Base와 Instruct 두 형태로 공개했어요. 작은 모델을 기기나 제한된 서버 자원에서 쓸 때 중요한 한국어 토큰 효율, 긴 문맥, KV 캐시 사용량을 함께 다듬은 공개 모델이에요. 2
핵심 요약
| 구분 | 핵심 | 왜 볼 만한가요 |
| 공개 모델 | 3B와 1.3B의 Base, Instruct 가중치 4종을 공개했어요 | 사전학습용 모델과 대화·지시 수행용 모델을 목적에 맞게 고를 수 있어요 |
| 모델 압축 | 3B 모델을 단계적으로 가지치기하고 증류해 1.3B 모델을 만들었어요 | 처음부터 작은 모델을 따로 학습하는 방식과 다른 압축 과정을 확인할 수 있어요 |
| 긴 문맥 | 1.3B 모델이 최대 32,768토큰을 지원해요 | 작은 모델로 긴 문서나 대화 기록을 처리하는 실험을 해 볼 수 있어요 |
| 메모리 효율 | 32K 문맥에서 KV 캐시 사용량을 전체 어텐션 모델보다 최대 약 72.7% 줄였다고 밝혔어요 | 메모리가 제한된 환경에서 긴 문맥 추론 비용을 낮추는 설계예요 |
| 한국어 처리 | 새 토크나이저가 이전 세대보다 한국어 토큰화 효율을 30% 넘게 높였어요 | 같은 한국어 입력을 더 적은 토큰으로 처리할 여지가 생겨요 |
1. 3B에서 1.3B까지, 배포 환경을 겨냥해 모델을 줄였어요
이번 공개 모델은 Kanana-2-3B-Base, Kanana-2-3B-Instruct, Kanana-2-1.3B-Base, Kanana-2-1.3B-Instruct 네 가지예요. 3B 모델은 TPU 클러스터에서 처음부터 사전학습한 뒤 지도 미세조정과 강화학습을 거쳤어요. 1.3B 모델은 3B 모델을 2B, 1.3B 순으로 단계적으로 줄이는 가지치기와 증류 과정에서 나왔어요. 3
카카오 개발진은 3B 모델의 첫 사전학습 단계에서 7.5조 토큰을 사용하고, 두 번째 단계에서 2조 토큰을 추가했다고 설명해요. 이후 더 큰 Kanana-2 모델을 교사 모델로 삼아 증류했고, 4K 문맥에서 시작해 32K까지 확장 학습했어요. 공개 자료에는 사전학습과 후속 학습에 카카오 사용자 데이터를 쓰지 않았다는 설명도 들어 있어요. 2
작은 모델에서도 32K 문맥을 다뤄요
1.3B 모델은 Sliding Window Attention과 전체 어텐션 계층을 3대 1 비율로 섞었어요. 가까운 토큰은 제한된 창 안에서 계산하고, 일부 계층은 전체 문맥을 살피는 구조예요. 슬라이딩 창 크기는 1,024토큰이며, 전체 어텐션만 쓰는 모델과 비교했을 때 32K 문맥의 KV 캐시 사용량을 최대 약 72.7% 줄였다고 밝혔어요. 3
이 수치는 모든 기기에서 메모리 사용량이 같은 비율로 줄어든다는 뜻은 아니에요. 실제 사용량은 추론 엔진, 양자화 방식, 배치 크기, 입력 길이에 따라 달라져요. 그래도 1.3B 크기와 32K 문맥을 함께 제공한 점은 모바일 앱, 로컬 도구, 제한된 GPU 서버에서 시험하기 좋은 조건이에요.
한국어 입력을 더 적은 토큰으로 나눠요
Kanana-2 토크나이저는 이전 세대보다 한국어 토큰화 효율을 30% 넘게 높였다고 해요. 한국어 문장을 더 적은 토큰으로 표현하면 같은 문맥 한도 안에 더 많은 내용을 넣을 수 있고, 입력 토큰 처리 비용도 줄일 수 있어요. 다만 이 비율은 카카오가 사용한 평가 조건에서 나온 값이므로, 실제 서비스의 문장 길이와 어휘에 따라 차이가 생길 수 있어요. 2
공식 모델 카드에는 MMLU, KMMLU, HumanEval, RULER-32K 등 여러 평가 결과가 실려 있어요. 비교표에서는 Kanana-2가 일부 한국어와 코드 과제에서 비슷한 크기의 Qwen3 모델보다 높은 점수를 보였고, 수학이나 긴 문맥 과제에서는 낮은 항목도 있었어요. 한 개의 종합 점수보다 서비스에 가까운 한국어 지시 수행, 코드 생성, 도구 호출, 긴 문서 검색 과제를 따로 시험하는 편이 정확해요. 3
공개 가중치와 라이선스를 함께 확인해야 해요
네 모델의 가중치는 Hugging Face에서 받을 수 있어요. 라이선스는 Kanana Open License로 표시돼요. 모델을 제품에 넣거나 수정본을 배포하려면 허용 범위와 제한 조건을 원문에서 먼저 확인해야 해요. 모델 크기가 작아도 실제 기기 배포에는 양자화, 메모리 측정, 응답 지연, 발열, 안전성 평가가 추가로 필요해요. 3
왜 중요한가요
한국어 중심의 온디바이스 AI를 만들 때는 모델의 벤치마크 점수만으로 배포 가능성을 판단하기 어려워요. 토크나이저가 한국어를 얼마나 잘게 나누는지, 긴 입력에서 KV 캐시가 얼마나 커지는지, 작은 모델로 줄인 뒤 지시 수행 능력이 얼마나 남는지가 실제 비용과 속도에 직접 영향을 줘요. Kanana-2는 이 세 가지를 공개 가중치와 기술 설명으로 함께 확인할 수 있게 했어요. 2
개발팀은 1.3B Instruct부터 자체 데이터로 점검해 볼 수 있어요. 한국어 대화와 요약, 긴 문서 질의, 도구 호출을 각각 나누고, 같은 하드웨어에서 메모리와 첫 토큰 지연 시간을 재면 활용 범위를 빠르게 좁힐 수 있어요. 공개 비교표는 출발점이고, 실제 서비스 데이터와 배포 환경에서 얻은 측정값이 최종 선택 기준이에요.
참고 자료
- 카카오, '카나나-2'의 경량 모델 4종 오픈소스로 공개 — GeekNews
- 더 작고 강해진 Kanana SLM 개발 — 카카오 기술 블로그
- kakaocorp/kanana-2-1.3b-base — Hugging Face 모델 카드
'IT & AI' 카테고리의 다른 글
| 구글 검색에서 소셜 콘텐츠 유입도 확인할 수 있어요 (0) | 2026.08.04 |
|---|---|
| 크래프톤 A.X K2 Raon-Speech 공개, 한국어 음성 AI를 하나의 모델로 (0) | 2026.08.04 |
| 여러 AI 에이전트를 한 팀으로 운영하는 LobeHub (0) | 2026.08.04 |
| Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요 (0) | 2026.08.03 |
| Qwen3.8-Max가 겨냥한 다음 단계, 며칠짜리 일을 끝내는 AI (0) | 2026.08.03 |