크래프톤 A.X K2 Raon-Speech 공개, 한국어 음성 AI를 하나의 모델로

크래프톤이 한국어와 영어를 다루는 음성 언어 모델 A.X K2 Raon-Speech를 공개했어요. 음성을 글로 바꾸는 STT와 글을 음성으로 읽는 TTS부터 음성 질의응답, 도구 호출까지 하나의 모델에서 처리해요. 한국어 음성 AI를 직접 시험하려는 개발팀이 모델 구조와 가중치, 실행 조건을 함께 살펴볼 수 있는 공개 모델이에요. 2
핵심 요약
| 구분 | 핵심 | 왜 볼 만한가요 |
| 모델 규모 | 전체 21.2B 가운데 약 3.5B 파라미터를 활성화하는 MoE 모델이에요 | 큰 전체 용량과 실제 추론에 쓰는 활성 파라미터를 나눠 설계했어요 |
| 음성 기능 | STT, TTS, SpeechQA, SpokenQA, 음성 대화를 한 모델에서 지원해요 | 여러 음성 파이프라인을 따로 연결하는 부담을 줄일 수 있어요 |
| 한국어 평가 | 30B 이하 공개 음성 언어 모델 비교에서 한국어 종합 0.72로 1위를 기록했다고 밝혔어요 | 한국어 음성 인식과 생성 과제를 함께 비교한 결과를 공개했어요 |
| 실행 환경 | BF16 가중치는 약 42.4GB이며 80GB GPU나 적절한 다중 GPU 구성을 권장해요 | 개인용 GPU보다 연구 서버와 고성능 추론 환경에 가까운 모델이에요 |
| 이용 조건 | CC BY-NC 4.0으로 연구와 비상업적 프로토타이핑에 초점을 맞췄어요 | 상용 제품 도입 전에는 라이선스와 화자 동의 조건을 확인해야 해요 |
1. 듣고 말하고 도구까지 부르는 한국어 음성 모델이에요
A.X K2 Raon-Speech는 SK텔레콤의 A.X K2 Light 20B-A3B 텍스트 백본에 크래프톤이 학습한 음성 모듈을 결합했어요. 텍스트 백본은 128개 전문가 중 토큰마다 상위 8개를 고르는 MoE 구조예요. 전체 파라미터는 약 21.2B지만 한 번의 추론에서 활성화하는 파라미터는 약 3.5B예요. 2
음성을 이해하는 AuT 인코더는 Qwen3-ASR 아키텍처를 바탕으로 만들었어요. 24개 레이어와 약 317M 파라미터를 갖고 있어요. 음성을 생성하는 부분에는 약 96M 파라미터의 Mimi 계열 신경망 코덱을 썼어요. 크래프톤은 이 두 모듈을 자체 데이터와 파이프라인으로 학습했다고 설명해요.
음성 입력과 출력을 한 체크포인트에 담았어요
공개 모델은 STT와 TTS뿐 아니라 오디오 맥락에 텍스트 질문을 붙이는 SpeechQA, 질문 자체를 음성으로 전달하는 SpokenQA를 지원해요. 텍스트 질의응답과 도구 호출도 처리할 수 있어요. 화자의 감정과 억양 같은 비언어 정보도 응답 생성에 활용해요. 3
참조 음성을 넣어 화자 특성을 반영하는 TTS와 앞선 음성의 운율을 이어가는 TTS continuation도 제공해요. 이 기능은 데모를 만들기에는 편리하지만, 식별 가능한 목소리를 사용할 때는 화자의 동의를 먼저 받아야 해요. 모델 카드도 이 책임을 이용자에게 명시하고 있어요.
한국어 24개와 영어 22개 평가를 공개했어요
크래프톤은 음성 인식, 음성 합성, 음성 이해, 음성 질의응답, 텍스트 질의응답, 도구 호출 등 6개 영역을 평가했어요. 한국어 24개와 영어 22개를 합쳐 46개 벤치마크를 사용했고, 결과를 0부터 1 사이로 정규화해 언어별 종합 점수를 계산했어요. 2
공개된 비교표에서는 30B 이하 공개 음성 언어 모델 가운데 한국어 종합 점수 0.72로 1위, 영어 종합 점수 0.75로 3위를 기록했어요. 같은 표에서 이전 Raon-Speech는 한국어 0.70, 영어 0.79를 받았어요. 새 모델이 모든 항목에서 이전 모델보다 높다는 뜻은 아니에요. 실제 서비스에 적용하려면 소음이 있는 한국어 대화, 긴 발화, 숫자와 고유명사 전사, 응답 지연처럼 제품에 가까운 조건을 따로 시험해야 해요.
42.4GB 가중치와 비상업 라이선스를 확인해야 해요
BF16 체크포인트의 가중치 용량은 약 42.4GB예요. 공식 안내는 80GB GPU 또는 적절한 다중 GPU 구성을 권장해요. vLLM-Omni용 호환 브랜치와 실행 예시도 공개했지만, 함께 제공한 단계 프로필은 약 96GB VRAM을 갖춘 GPU 한 장을 대상으로 해요. 로컬 PC에서 가볍게 돌리는 모델보다는 연구실이나 기업의 GPU 서버에서 평가하기 알맞아요. 2
라이선스는 CC BY-NC 4.0이에요. 연구와 비상업적 프로토타이핑에는 쓸 수 있지만, 상용 서비스에 바로 넣을 수 있는 허가로 해석하면 안 돼요. 모델 코드를 불러올 때 `trust_remote_code`를 사용하는 구조라서 실행 전 저장소 코드와 고정할 리비전도 검토해야 해요.
왜 중요한가요
한국어 음성 서비스를 만들 때 STT, 언어 모델, TTS를 각각 고르고 연결하면 구성 요소마다 지연 시간과 오류가 쌓여요. A.X K2 Raon-Speech는 듣기와 답변 생성, 말하기를 한 모델 안에서 실험할 수 있게 해요. 한국어 음성 인식만 보는 평가를 넘어 질의응답과 도구 호출, 화자 정보 활용까지 공개한 점도 개발팀이 비교할 범위를 넓혀 줘요. 3
다만 공개 벤치마크 1위라는 문구만 보고 제품 적합성을 결정하기는 어려워요. 42.4GB 가중치와 높은 VRAM 요구량은 추론 비용과 운영 난도를 높여요. 비상업 라이선스와 화자 동의 조건도 사업화 범위를 제한해요. 개발팀은 먼저 공개 음성 샘플과 소규모 자체 평가로 한국어 전사 정확도, 첫 응답 시간, 합성 음질, 도구 호출 성공률을 따로 측정하는 편이 좋아요.
참고 자료
- 크래프톤, 21B 한영 이중언어 음성 AI 모델 A.X K2 Raon-Speech 공개 — GeekNews
- A.X K2 Raon-Speech 모델 카드 — KRAFTON, Hugging Face
- A.X K2 Raon 기술 소개 — KRAFTON AI
'IT & AI' 카테고리의 다른 글
| 엘리베이터가 늦는 이유, 버튼 뒤에서 돌아가는 배차 알고리듬 (0) | 2026.08.04 |
|---|---|
| 구글 검색에서 소셜 콘텐츠 유입도 확인할 수 있어요 (0) | 2026.08.04 |
| 카카오가 공개한 경량 언어모델 Kanana-2, 1.3B로 32K 문맥까지 (0) | 2026.08.04 |
| 여러 AI 에이전트를 한 팀으로 운영하는 LobeHub (0) | 2026.08.04 |
| Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요 (0) | 2026.08.03 |