내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To Speech
내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To SpeechAI 뉴스 썸네일말을 듣고 답하는 AI를 만들려면 음성 감지, 받아쓰기, 답변 생성, 음성 합성을 차례로 연결해야 해요. Hugging Face의 Speech To Speech는 이 과정을 한 파이프라인으로 묶고, 각 부품을 원하는 모델로 바꿀 수 있게 만든 오픈소스 프로젝트예요. 1핵심 요약구분내용처리 구조VAD, STT, LLM, TTS가 각각 별도 스레드에서 움직이고 큐로 데이터를 넘겨요.연결 방식OpenAI Realtime의 핵심 이벤트를 WebSocket과 WebRTC로 제공해요.모델 선택STT, LLM, TTS를 하드웨어와 언어에 맞춰 교체할 수 있어요.로컬 실행llama.cpp, vLLM, MLX LM 같은..
로컬 TTS 모델 55종을 한자리에서 비교하는 tts-bench가 나왔어요
로컬 TTS 모델 55종을 한자리에서 비교하는 tts-bench가 나왔어요AI 뉴스 썸네일로컬에서 돌릴 수 있는 TTS 모델은 빠르게 늘었지만, 실제로 고르기는 꽤 번거로워요. tts-bench는 55개 음성 합성 모델을 속도, 청취 예시, 객관 지표로 나눠 비교할 수 있게 만든 오픈소스 벤치마크예요.핵심 요약구분핵심왜 볼 만한가요모델 범위로컬 TTS 모델 55종을 비교해요모델별 데모를 따로 찾아 듣는 시간을 줄일 수 있어요측정 방식TTFA, RTF, 메모리, UTMOS, WER, SIM을 나눠 봐요빠른 모델과 듣기 좋은 모델을 같은 기준으로 섞어 판단하지 않게 돼요실행 환경CPU, CUDA, Apple Silicon 결과를 따로 보여줘요보유한 장비에서 쓸 만한 모델을 먼저 좁힐 수 있어요청취 테스트설치..