내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To Speech
내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To SpeechAI 뉴스 썸네일말을 듣고 답하는 AI를 만들려면 음성 감지, 받아쓰기, 답변 생성, 음성 합성을 차례로 연결해야 해요. Hugging Face의 Speech To Speech는 이 과정을 한 파이프라인으로 묶고, 각 부품을 원하는 모델로 바꿀 수 있게 만든 오픈소스 프로젝트예요. 1핵심 요약구분내용처리 구조VAD, STT, LLM, TTS가 각각 별도 스레드에서 움직이고 큐로 데이터를 넘겨요.연결 방식OpenAI Realtime의 핵심 이벤트를 WebSocket과 WebRTC로 제공해요.모델 선택STT, LLM, TTS를 하드웨어와 언어에 맞춰 교체할 수 있어요.로컬 실행llama.cpp, vLLM, MLX LM 같은..
문서 처리 도구를 하나로 묶은 xberg, HWP부터 OCR·RAG까지 다뤄요
문서 처리 도구를 하나로 묶은 xberg, HWP부터 OCR·RAG까지 다뤄요IT & AI 뉴스 썸네일PDF 파서, OCR, 표 추출기, 음성 전사 도구를 따로 연결하다 보면 입력 형식이 하나 늘 때마다 관리할 코드도 함께 늘어요. xberg는 여러 문서 처리 단계를 Rust 기반 코어에 모으고, 같은 결과 형식으로 꺼내 쓰게 만든 오픈소스 프레임워크예요. 1핵심 요약구분내용입력PDF, 오피스 문서, 이미지, 오디오, URL, 압축 파일, 소스 트리를 처리해요.출력일반 텍스트, Markdown, Djot, HTML, JSON 트리와 구조화 결과를 지원해요.문서 분석OCR, 표·레이아웃 복원, 메타데이터 추출, 음성 전사를 한 도구에서 선택할 수 있어요.개발 연동라이브러리, CLI, REST API, MC..
CodeAlmanac, AI 코딩 도구가 코드 밖의 맥락까지 읽게 해요
CodeAlmanac, AI 코딩 도구가 코드 밖의 맥락까지 읽게 해요AI 뉴스 썸네일코드를 읽으면 현재 구현은 알 수 있어요. 하지만 왜 이런 구조를 골랐는지, 과거에 어떤 시도가 실패했는지, 반드시 지켜야 할 조건이 무엇인지는 코드만으로 찾기 어려워요. CodeAlmanac은 이런 정보를 저장소 안의 위키로 남겨 AI 코딩 도구와 개발자가 함께 읽게 해요. 1핵심 요약구분핵심왜 볼 만한가요저장 방식설계 결정과 흐름, 불변 조건, 주의점을 마크다운으로 저장해요문서를 코드와 같은 Git 변경 내역에서 검토할 수 있어요탐색 방식사람과 코딩 도구가 같은 `search`, `show`, `topics`, `health`, `validate` 명령을 써요별도 문서 서비스에 접속하지 않고 터미널에서 맥락을 찾을 ..
로컬 TTS 모델 55종을 한자리에서 비교하는 tts-bench가 나왔어요
로컬 TTS 모델 55종을 한자리에서 비교하는 tts-bench가 나왔어요AI 뉴스 썸네일로컬에서 돌릴 수 있는 TTS 모델은 빠르게 늘었지만, 실제로 고르기는 꽤 번거로워요. tts-bench는 55개 음성 합성 모델을 속도, 청취 예시, 객관 지표로 나눠 비교할 수 있게 만든 오픈소스 벤치마크예요.핵심 요약구분핵심왜 볼 만한가요모델 범위로컬 TTS 모델 55종을 비교해요모델별 데모를 따로 찾아 듣는 시간을 줄일 수 있어요측정 방식TTFA, RTF, 메모리, UTMOS, WER, SIM을 나눠 봐요빠른 모델과 듣기 좋은 모델을 같은 기준으로 섞어 판단하지 않게 돼요실행 환경CPU, CUDA, Apple Silicon 결과를 따로 보여줘요보유한 장비에서 쓸 만한 모델을 먼저 좁힐 수 있어요청취 테스트설치..