본문 바로가기

728x90

Whisper

(4)
내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To Speech 내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To SpeechAI 뉴스 썸네일말을 듣고 답하는 AI를 만들려면 음성 감지, 받아쓰기, 답변 생성, 음성 합성을 차례로 연결해야 해요. Hugging Face의 Speech To Speech는 이 과정을 한 파이프라인으로 묶고, 각 부품을 원하는 모델로 바꿀 수 있게 만든 오픈소스 프로젝트예요. 1핵심 요약구분내용처리 구조VAD, STT, LLM, TTS가 각각 별도 스레드에서 움직이고 큐로 데이터를 넘겨요.연결 방식OpenAI Realtime의 핵심 이벤트를 WebSocket과 WebRTC로 제공해요.모델 선택STT, LLM, TTS를 하드웨어와 언어에 맞춰 교체할 수 있어요.로컬 실행llama.cpp, vLLM, MLX LM 같은..
문서 처리 도구를 하나로 묶은 xberg, HWP부터 OCR·RAG까지 다뤄요 문서 처리 도구를 하나로 묶은 xberg, HWP부터 OCR·RAG까지 다뤄요IT & AI 뉴스 썸네일PDF 파서, OCR, 표 추출기, 음성 전사 도구를 따로 연결하다 보면 입력 형식이 하나 늘 때마다 관리할 코드도 함께 늘어요. xberg는 여러 문서 처리 단계를 Rust 기반 코어에 모으고, 같은 결과 형식으로 꺼내 쓰게 만든 오픈소스 프레임워크예요. 1핵심 요약구분내용입력PDF, 오피스 문서, 이미지, 오디오, URL, 압축 파일, 소스 트리를 처리해요.출력일반 텍스트, Markdown, Djot, HTML, JSON 트리와 구조화 결과를 지원해요.문서 분석OCR, 표·레이아웃 복원, 메타데이터 추출, 음성 전사를 한 도구에서 선택할 수 있어요.개발 연동라이브러리, CLI, REST API, MC..
애플 SpeechAnalyzer, Whisper보다 정확하고 3배 빨랐어요 애플 SpeechAnalyzer, Whisper보다 정확하고 3배 빨랐어요AI 뉴스 썸네일애플의 새 온디바이스 음성 인식 API인 SpeechAnalyzer가 공개 벤치마크에서 Whisper Small보다 낮은 단어 오류율을 기록했어요. 기존 SFSpeechRecognizer와 비교하면 오류가 3.5~4배 줄었고, 구두점과 대소문자까지 정리된 결과를 내놓았어요. 다만 영어 낭독 데이터와 Apple M2 Pro 한 대에서 진행한 시험이라 실제 앱에 도입하기 전에는 사용 환경에 맞춘 재검증이 필요해요. 1핵심 요약구분핵심왜 볼 만한가요정확도SpeechAnalyzer의 WER는 깨끗한 음성 2.12%, 잡음이 많은 음성 4.56%였어요Whisper Small과 기존 애플 API보다 낮은 오류율을 기록했어요속도..
Kokoro TTS, 로컬 CPU만으로 음성 합성이 현실적인 이유 Kokoro TTS, 로컬 CPU만으로 음성 합성이 현실적인 이유AI 뉴스 썸네일로컬 AI를 돌릴 때 GPU는 늘 부족해요. 그래서 음성 합성까지 GPU를 차지하면 로컬 LLM과 함께 쓰기 어려웠어요. Kokoro 사례는 작은 TTS 모델과 OpenAI 호환 API를 조합하면 CPU만으로도 개인용 음성 인터페이스를 만들 수 있다는 쪽에 가까워요. 1핵심 요약구분핵심왜 봐야 하나요로컬 음성 합성Kokoro 82M 모델을 CPU로 실행해 TTS를 처리해요GPU를 로컬 LLM 추론에 남겨둘 수 있어요실행 방식Kokoro-FastAPI 컨테이너가 OpenAI speech API와 비슷한 인터페이스를 제공해요기존 음성 API 기반 코드를 로컬 엔드포인트로 옮기기 쉬워요성능 감각짧은 문단 합성에서 i7-4770K ..

728x90