본문 바로가기

IT & AI

음성 복제부터 더빙, 받아쓰기까지 내 컴퓨터에서 처리하는 오픈소스 VoiceStudio

728x90

음성 복제부터 더빙, 받아쓰기까지 내 컴퓨터에서 처리하는 오픈소스 VoiceStudio

AI 뉴스 썸네일
AI 뉴스 썸네일

목소리를 복제하거나 영상을 더빙하려면 보통 클라우드 서비스에 가입하고 API 키를 발급받아야 해요. VoiceStudio는 이 작업을 전부 내 컴퓨터에서 처리하는 오픈소스 데스크톱 앱이에요. 계정도, API 키도, 구독료도 없이 필요한 모델만 내려받으면 오프라인에서도 쓸 수 있어요. 1

핵심 요약

구분핵심왜 볼 만한가요
오픈소스 데스크톱 앱음성 복제, 보이스 디자인, 더빙, 받아쓰기, 오디오북 제작을 하나의 앱에서 로컬 처리음성 데이터가 내 컴퓨터 밖으로 나가지 않는 구조라 민감한 샘플도 다루기 좋아요
음성 복제깨끗한 샘플 5~15초만 있으면 별도 학습 없이 목소리 복제짧은 녹음으로 내 목소리를 그대로 재현할 수 있어요
더빙 파이프라인받아쓰기 → 번역 → 화자별 목소리 합성 → 영상 내보내기언어 너머 영상 제작을 한 번에 끝낼 수 있어요
엔진 선택음성 합성 16종, 음성 인식 11종, 언어 646개엔진마다 품질과 복제 지원이 달라서 작업에 맞게 골라 쓸 수 있어요

1. 목소리 15초면 복제되는 로컬 음성 스튜디오

VoiceStudio는 음성 작업에 필요한 기능을 데스크톱 앱 하나에 모아둔 프로젝트예요. 깨끗한 음성 샘플 5~15초만 준비하면 별도 학습 과정 없이 그 목소리를 복제하고, 입력한 문장을 그 목소리로 읽게 할 수 있어요. 개발 문서에는 3초 샘플로도 동작하지만 5~15초가 더 나은 결과를 낸다고 안내돼 있어요. 1 2

기존 목소리를 그대로 쓰지 않고 새로 만들 수도 있어요. 나이, 억양, 음높이, 말투를 글로 설명하면 그 조건에 맞는 새 목소리를 생성해요. 예를 들어 "진지한 미국 뉴스 앵커 톤"처럼 스타일을 묘사하면 그에 가까운 목소리가 나와요. 2

영상 더빙 흐름도 한곳에서 처리돼요. 영상의 말을 텍스트로 옮기고, 번역한 뒤, 화자별 목소리를 유지하면서 합성해 더빙 영상으로 내보내요. EPUB나 PDF를 불러와 등장인물마다 다른 목소리를 배정하고 장별 음성을 만들어 .m4b 오디오북으로 저장하는 기능도 있어요. 1

받아쓰기 위젯도 붙어 있어요. 단축키를 누르고 말하면 받아쓴 내용을 현재 쓰고 있는 앱에 바로 입력하고, 로컬 LLM으로 문장을 다듬을 수도 있어요. 자동 입력이 안 되는 환경에서는 클립보드로 복사하고, 리눅스 Wayland에서는 기본적으로 복사 방식을 써요. 1

2. 엔진을 골라 쓰고 다른 앱에서도 호출할 수 있는 구조

VoiceStudio는 하나의 모델만 쓰는 게 아니라 음성 합성 엔진 16개와 음성 인식 엔진 11개 중에서 골라 쓰는 구조예요. 언어 목록은 646개까지 나열돼 있지만, 실제 지원 언어와 음성 복제 가능 여부, 품질은 엔진마다 다르다고 문서에 명시돼 있어요. 음성과 배경음 분리, 화자 구분, AudioSeal 워터마크 삽입과 감지, 여러 파일 일괄 처리 같은 부가 기능도 들어 있어요. 1

로컬 API와 OpenAI 호환 음성 API, MCP 서버를 제공해서 다른 앱이나 AI 에이전트에서도 음성 생성과 텍스트 변환을 호출할 수 있어요. 데스크톱 앱을 음성 처리 서버처럼 쓸 수 있는 셈이에요. 1

실행 환경은 macOS 13.3 이상 Apple Silicon, Windows 10/11 x64, Linux x86_64예요. Docker 이미지도 있어요. Intel Mac은 별도 컴퓨터의 백엔드에 연결해야 하고, 리눅스 AppImage는 glibc 2.39 이상이 필요해요. GPU 없이 CPU로도 돌아가고, 기본 작업은 RAM 16GB 이상을 권장해요. GPU를 쓸 때는 VRAM 4GB로 동작하지만 8GB 이상을 권장하고, 대형 엔진은 더 많은 메모리를 요구해요. 1 2

앱 자체는 AGPL-3.0 라이선스예요. 다만 내려받는 모델은 각자의 라이선스를 따르고, 기본 OmniVoice 가중치는 상업적 이용이 제한되는 조건으로 배포돼요. 생성된 오디오를 상업적으로 쓰려면 선택한 모델의 이용 조건을 먼저 확인해야 해요. 2

왜 중요한가요

음성 복제와 더빙은 최근 몇 년 사이 클라우드 서비스 중심으로 빠르게 퍼졌어요. 편하지만, 목소리 샘플이나 미완성 콘텐츠를 외부 서버로 보내야 한다는 부담이 늘 따라다녔어요. VoiceStudio는 이 지점을 로컬 실행으로 바꿔요. 음성과 프로젝트는 기본적으로 내 컴퓨터에 저장되고, 원격 서버나 Colab을 연결로 바꾼 경우에만 오디오가 해당 서버로 전송돼요. 2

개발자 입장에서는 MCP 서버와 OpenAI 호환 API가 가장 실용적인 부분이에요. 음성 합성이 필요한 도구나 에이전트를 만들 때 API 키 발급과 과금 걱정 없이 내 컴퓨터의 음성 처리 능력을 그대로 붙일 수 있어요. OmniVoice, WhisperX, Demucs, Pyannote 같은 검증된 오픈소스 구성요소를 하나의 앱으로 묶었다는 점도 직접 조립하는 수고를 줄여줘요. 2

한계도 분명해요. "646개 언어 지원"이라는 숫자는 후보 목록이고, 실제 품질은 엔진 선택에 달려 있어요. 한국어 음성 복제 품질은 엔진마다 차이가 크니 직접 돌려보고 판단하는 게 좋아요. 기본 가중치의 상업 이용 제한도 실무에서는 꼭 챙겨야 할 조건이에요.

728x90

참고 자료

  1. VoiceStudio - 음성 복제, 더빙, 받아쓰기를 로컬에서 처리하는 오픈소스 스튜디오 — GeekNews
  2. debpalash/VoiceStudio — GitHub
본 글은 정보 제공 목적이며, 투자 권유가 아닙니다. 모든 투자의 책임은 투자자 본인에게 있습니다.
728x90