Kimi K3 가중치 공개, 2.8조 파라미터 모델을 직접 배포할 수 있어요

Moonshot AI가 Kimi K3의 전체 가중치와 실행 코드를 Hugging Face에 공개했어요. 2.8조 개 파라미터, 104만 8,576 토큰 컨텍스트, 이미지와 영상을 다루는 멀티모달 기능을 한 모델에 담았어요. 이제 발표 자료를 보는 단계를 넘어 라이선스와 배포 조건을 직접 확인할 수 있어요. 1
핵심 요약
| 구분 | 핵심 | 왜 볼 만한가요 |
| 공개 범위 | 모델 가중치와 실행 코드가 Hugging Face에 올라왔어요 | 연구팀과 기업이 자체 환경에서 모델을 시험하고 수정할 수 있어요 |
| 모델 구조 | 전체 2.8조 개 중 토큰마다 1,040억 개 파라미터를 활성화해요 | 전체 규모와 한 번의 추론에 쓰는 계산량을 나눠 봐야 해요 |
| 긴 작업 | 104만 8,576 토큰 컨텍스트와 멀티모달 입력을 지원해요 | 큰 코드 저장소, 문서 묶음, 화면을 함께 다루는 작업을 겨냥해요 |
| 배포 방식 | Transformers, vLLM, SGLang, Docker 실행 경로를 제공해요 | 기존 OpenAI 호환 도구와 연결해 검증하기 쉬워졌어요 |
| 도입 조건 | 자체 라이선스에 매출과 서비스 규모별 조건이 있어요 | 상업 서비스는 가중치 공개 여부와 이용 조건을 따로 확인해야 해요 |
1. Kimi K3 공개로 무엇이 달라졌나요
Kimi K3는 896개 전문가 가운데 토큰마다 16개를 선택하는 MoE 모델이에요. 전체 파라미터는 2.8조 개지만 한 번에 활성화되는 파라미터는 1,040억 개예요. Kimi Delta Attention, Attention Residuals, Stable LatentMoE를 결합했고, Moonshot AI는 Kimi K2보다 전체 스케일링 효율을 약 2.5배 높였다고 설명해요. 2
컨텍스트 길이는 104만 8,576 토큰이에요. 401M 규모 MoonViT-V2 비전 인코더를 붙여 텍스트와 이미지뿐 아니라 비디오 이해도 지원한다고 소개해요. 긴 저장소를 탐색하면서 터미널 도구를 쓰거나, 실행 화면을 확인하며 코드를 고치는 작업에 맞춘 구성이에요. 다만 모델 요약표의 모달리티 항목에는 텍스트와 이미지만 적혀 있어요. 비디오 지원 범위는 실제 API와 배포 환경에서 따로 확인하는 편이 안전해요.
직접 배포할 수 있지만 가벼운 모델은 아니에요
가중치는 MXFP4, 활성 값은 MXFP8 형식으로 양자화 인식 학습됐어요. Hugging Face Transformers에서 불러올 수 있고, vLLM과 SGLang으로 OpenAI 호환 엔드포인트를 열 수 있어요. Docker Model Runner용 명령도 제공해요. 기존 채팅이나 코딩 도구가 OpenAI 형식 요청을 지원한다면 연결 작업을 줄일 수 있어요.
배포 문서가 있다고 개인용 GPU 한두 장에서 전체 모델을 운용할 수 있다는 뜻은 아니에요. 가중치 자체가 매우 크고, 긴 컨텍스트를 쓰면 KV 캐시와 처리량까지 함께 계산해야 해요. 팀에서 검토한다면 먼저 제공 API로 작업 적합성을 확인하고, 자체 배포는 필요한 동시 사용자 수와 응답 속도, 장비 비용을 넣어 별도로 계산하는 편이 현실적이에요.
도구 호출에서는 응답 상태를 보존해야 해요
Kimi K3는 추론 과정이 켜진 상태로 동작하며 `reasoning_content`를 반환해요. 다중 턴 대화나 도구 호출을 이어 갈 때는 이전 assistant 메시지의 `content`만 보내면 안 돼요. `reasoning_content`와 `tool_calls`를 포함한 전체 메시지를 다음 요청에 다시 넣어야 해요. 이 규칙을 놓치면 긴 작업에서 이전 추론 상태와 도구 실행 맥락이 끊길 수 있어요. 2
평가 점수도 실행 조건과 함께 읽어야 해요. 공식 모델 카드에는 GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1이 적혀 있어요. 대부분 최대 추론 노력과 temperature 1.0 조건에서 측정됐어요. 비교 모델마다 사용한 코딩 도구, 컨텍스트 관리 방식, GPU가 다를 수 있어요. 숫자 한 줄보다 같은 저장소와 권한, 테스트 환경에서 직접 비교한 결과가 도입 판단에 더 가까워요.
오픈 가중치와 자유로운 상업 이용은 같은 말이 아니에요
Kimi K3 License는 사용, 수정, 배포, 미세조정과 파생물 제작을 허용해요. 대신 서비스형 모델 사업자의 계열사 합산 매출이 연속 12개월 동안 2,000만 달러를 넘으면 상업적 이용 전에 Moonshot AI와 별도 계약을 맺어야 해요. 월간 활성 사용자 1억 명 또는 월매출 2,000만 달러를 넘는 상용 제품에는 사용자 화면에 `Kimi K3`를 눈에 띄게 표시해야 한다는 조건도 있어요. 3
사내에서만 쓰거나 Moonshot AI의 공식 제품과 인증된 추론 파트너를 통해 이용할 때는 일부 조건이 적용되지 않아요. 실제 제품에 넣을 때는 기술 검증과 함께 서비스 형태, 매출 기준, 표시 의무를 법무 검토에 포함해야 해요. `오픈 가중치`라는 설명만 보고 일반적인 허용 라이선스와 같다고 가정하면 곤란해요.
왜 중요한가요
이번 공개로 개발팀이 Kimi K3의 구조와 가중치, 실행 코드를 같은 저장소에서 확인할 수 있게 됐어요. 공급사가 공개한 점수를 읽는 데서 끝나지 않고, 자체 데이터와 도구 권한, 긴 세션에서의 오류 복구 방식으로 모델을 시험할 수 있어요. 특히 100만 토큰 컨텍스트와 멀티모달 입력이 실제 코딩 작업의 완료율을 높이는지 확인할 자료가 생겼어요. 2
실무 도입에서는 세 가지를 같이 봐야 해요. 같은 업무를 끝내는 데 든 총 토큰과 시간, 실패 뒤 사람이 고치는 비용, 라이선스 조건이에요. 벤치마크가 높아도 장비 비용이나 도구 호출 안정성이 맞지 않으면 운영 모델로 쓰기 어려워요. 반대로 API로 먼저 검증한 뒤 자주 반복되는 내부 작업만 자체 배포로 옮기면 가중치 접근 권한을 실제 이점으로 바꿀 수 있어요.
참고 자료
- Hugging Face에 공개된 Kimi-K3 — GeekNews
- Kimi K3 Model Card — Moonshot AI, Hugging Face
- Kimi K3 License — Moonshot AI
'IT & AI' 카테고리의 다른 글
| Anthropic이 오픈 웨이트 전면 금지에 반대한 이유 (0) | 2026.07.28 |
|---|---|
| PostgreSQL 내부를 3D 도시로 걷는 PGSimCity (0) | 2026.07.28 |
| 데이터 도구를 이름 대신 흐름으로 이해하는 법 (0) | 2026.07.28 |
| 바티칸의 AI 윤리 기준은 기술 기업에 어떻게 닿을까요 (0) | 2026.07.28 |
| 100만 행 데이터 그리드가 버티는 법, 양축 가상화부터 DOM 풀링까지 (0) | 2026.07.28 |