본문 바로가기

728x90

TTS

(4)
내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To Speech 내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To SpeechAI 뉴스 썸네일말을 듣고 답하는 AI를 만들려면 음성 감지, 받아쓰기, 답변 생성, 음성 합성을 차례로 연결해야 해요. Hugging Face의 Speech To Speech는 이 과정을 한 파이프라인으로 묶고, 각 부품을 원하는 모델로 바꿀 수 있게 만든 오픈소스 프로젝트예요. 1핵심 요약구분내용처리 구조VAD, STT, LLM, TTS가 각각 별도 스레드에서 움직이고 큐로 데이터를 넘겨요.연결 방식OpenAI Realtime의 핵심 이벤트를 WebSocket과 WebRTC로 제공해요.모델 선택STT, LLM, TTS를 하드웨어와 언어에 맞춰 교체할 수 있어요.로컬 실행llama.cpp, vLLM, MLX LM 같은..
크래프톤 A.X K2 Raon-Speech 공개, 한국어 음성 AI를 하나의 모델로 크래프톤 A.X K2 Raon-Speech 공개, 한국어 음성 AI를 하나의 모델로AI 뉴스 썸네일크래프톤이 한국어와 영어를 다루는 음성 언어 모델 A.X K2 Raon-Speech를 공개했어요. 음성을 글로 바꾸는 STT와 글을 음성으로 읽는 TTS부터 음성 질의응답, 도구 호출까지 하나의 모델에서 처리해요. 한국어 음성 AI를 직접 시험하려는 개발팀이 모델 구조와 가중치, 실행 조건을 함께 살펴볼 수 있는 공개 모델이에요. 2핵심 요약구분핵심왜 볼 만한가요모델 규모전체 21.2B 가운데 약 3.5B 파라미터를 활성화하는 MoE 모델이에요큰 전체 용량과 실제 추론에 쓰는 활성 파라미터를 나눠 설계했어요음성 기능STT, TTS, SpeechQA, SpokenQA, 음성 대화를 한 모델에서 지원해요여러 음..
로컬 TTS 모델 55종을 한자리에서 비교하는 tts-bench가 나왔어요 로컬 TTS 모델 55종을 한자리에서 비교하는 tts-bench가 나왔어요AI 뉴스 썸네일로컬에서 돌릴 수 있는 TTS 모델은 빠르게 늘었지만, 실제로 고르기는 꽤 번거로워요. tts-bench는 55개 음성 합성 모델을 속도, 청취 예시, 객관 지표로 나눠 비교할 수 있게 만든 오픈소스 벤치마크예요.핵심 요약구분핵심왜 볼 만한가요모델 범위로컬 TTS 모델 55종을 비교해요모델별 데모를 따로 찾아 듣는 시간을 줄일 수 있어요측정 방식TTFA, RTF, 메모리, UTMOS, WER, SIM을 나눠 봐요빠른 모델과 듣기 좋은 모델을 같은 기준으로 섞어 판단하지 않게 돼요실행 환경CPU, CUDA, Apple Silicon 결과를 따로 보여줘요보유한 장비에서 쓸 만한 모델을 먼저 좁힐 수 있어요청취 테스트설치..
Kokoro TTS, 로컬 CPU만으로 음성 합성이 현실적인 이유 Kokoro TTS, 로컬 CPU만으로 음성 합성이 현실적인 이유AI 뉴스 썸네일로컬 AI를 돌릴 때 GPU는 늘 부족해요. 그래서 음성 합성까지 GPU를 차지하면 로컬 LLM과 함께 쓰기 어려웠어요. Kokoro 사례는 작은 TTS 모델과 OpenAI 호환 API를 조합하면 CPU만으로도 개인용 음성 인터페이스를 만들 수 있다는 쪽에 가까워요. 1핵심 요약구분핵심왜 봐야 하나요로컬 음성 합성Kokoro 82M 모델을 CPU로 실행해 TTS를 처리해요GPU를 로컬 LLM 추론에 남겨둘 수 있어요실행 방식Kokoro-FastAPI 컨테이너가 OpenAI speech API와 비슷한 인터페이스를 제공해요기존 음성 API 기반 코드를 로컬 엔드포인트로 옮기기 쉬워요성능 감각짧은 문단 합성에서 i7-4770K ..

728x90