본문 바로가기

728x90

Llamacpp

(8)
내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To Speech 내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To SpeechAI 뉴스 썸네일말을 듣고 답하는 AI를 만들려면 음성 감지, 받아쓰기, 답변 생성, 음성 합성을 차례로 연결해야 해요. Hugging Face의 Speech To Speech는 이 과정을 한 파이프라인으로 묶고, 각 부품을 원하는 모델로 바꿀 수 있게 만든 오픈소스 프로젝트예요. 1핵심 요약구분내용처리 구조VAD, STT, LLM, TTS가 각각 별도 스레드에서 움직이고 큐로 데이터를 넘겨요.연결 방식OpenAI Realtime의 핵심 이벤트를 WebSocket과 WebRTC로 제공해요.모델 선택STT, LLM, TTS를 하드웨어와 언어에 맞춰 교체할 수 있어요.로컬 실행llama.cpp, vLLM, MLX LM 같은..
Qwen3.8-27B 4비트 로컬 실행, 24GB Mac이 현실적인 기준이에요 Qwen3.8-27B 4비트 로컬 실행, 24GB Mac이 현실적인 기준이에요Qwen3.8-27B 로컬 실행 썸네일270억 파라미터 모델을 개인 장비에서 돌릴 때 가장 먼저 막히는 곳은 메모리예요. Unsloth가 공개한 Qwen3.8-27B 양자화 판은 4비트 기준으로 총 17~19GB 메모리를 요구해요. 24GB 통합 메모리를 갖춘 Mac이나 24GB급 GPU 데스크톱이라면 로컬 실행을 시험해 볼 수 있는 크기예요. 2핵심 요약구분공개된 내용실제로 확인할 점모델270억 파라미터 밀집형 모델이에요비전과 추론을 함께 지원해요4비트 메모리총 17~19GB가 필요해요24GB 장비가 실행 여유를 두기 좋아요실행 형식GGUF와 NVFP4를 제공해요GPU 세대와 실행 도구에 맞춰 골라야 해요문맥 길이기본 262,..
Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실 Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실Qwen3.8 로컬 실행 썸네일Unsloth가 Qwen3.8-2.4T-A95B를 397GB까지 줄인 GGUF와 실행 가이드를 공개했어요. 4.9TB에 이르는 BF16 모델보다 91% 작지만, 일반 노트북에서 가볍게 돌리는 모델은 아니에요. 수백 GB 메모리를 갖춘 워크스테이션에서 초대형 MoE 모델을 직접 운영할 길을 연 사례에 가까워요. 1핵심 요약구분공개된 내용실제 의미모델 구조전체 2.4조 파라미터, 토큰당 950억 파라미터 활성화모든 가중치를 매번 계산하지 않는 MoE 모델이에요저장·메모리 규모BF16 4.9TB, Dynamic 1-bit XXXS 397GB91% 줄었어도 고사양 워크스테이션이 필요해요중간 선택지1-bit ..
20GB 안으로 들어온 30B 코딩 모델, Meta Muse Glimmer 20GB 안으로 들어온 30B 코딩 모델, Meta Muse GlimmerAI 뉴스 썸네일Meta가 30B 파라미터 로컬 코딩 모델 Muse Glimmer를 공개했어요. 약 4비트로 양자화한 모델은 20GB보다 작아서 24GB나 32GB 메모리를 갖춘 Mac·PC에서 에이전트 작업을 돌리는 구성을 겨냥해요. 1핵심 요약구분핵심왜 볼 만한가요공개 방식30B 모델 가중치를 Apache 2.0 라이선스로 공개했어요사용 조건이 비교적 명확한 오픈 웨이트 코딩 모델 선택지가 늘었어요로컬 실행약 4비트 양자화로 모델 크기를 20GB 미만으로 줄였어요24GB·32GB급 소비자 하드웨어에서 로컬 에이전트를 구성할 수 있어요작업 범위함수 호출, 코드 작성·디버깅, 도구 오류 복구, 이미지 입력을 다뤄요단순 코드 완성보다..
Kimi K3를 로컬에서 돌리려면 메모리가 얼마나 필요할까요 Kimi K3를 로컬에서 돌리려면 메모리가 얼마나 필요할까요Kimi K3 로컬 실행 썸네일Moonshot AI의 Kimi K3는 오픈 웨이트 모델이지만, 개인용 PC 한 대에 가볍게 올릴 수 있는 크기는 아니에요. Unsloth가 공개한 가장 작은 권장 양자화도 파일이 594GB이고, 실행에는 RAM과 VRAM을 합쳐 최소 610GB가 필요해요. 로컬 실행에서 말하는 ‘로컬’이 고성능 워크스테이션이나 여러 장의 GPU를 포함한다는 점부터 확인해야 해요. 1핵심 요약구분확인할 내용실제 의미모델 규모전체 2.8조, 추론 시 1,040억 매개변수 활성화MoE 구조여도 저장 공간과 메모리 요구량은 매우 커요가장 작은 권장 양자화`UD-IQ1_S` 594GB실행 환경에는 최소 610GB의 총 메모리가 필요해요품질..
오픈 웨이트 AI, 모델보다 생태계 경쟁이 중요해졌어요 오픈 웨이트 AI, 모델보다 생태계 경쟁이 중요해졌어요IT & AI 뉴스 썸네일오픈 웨이트 AI의 경쟁 기준이 모델 한 개의 성능에서 그 주변의 도구와 운영 체계로 넓어지고 있어요. Kubernetes가 공통 기반 위에 네트워킹, 스토리지, 관측성 도구를 키웠듯이 AI에서도 모델 서빙과 미세조정, 평가, 런타임이 하나의 생태계로 묶이는 흐름이에요. 다만 모델 가중치를 공개하는 것과 완전한 오픈 소스는 구분해서 봐야 해요. 1핵심 요약구분핵심왜 볼만한가요경쟁 단위모델 성능뿐 아니라 서빙, 평가, 관측성, 미세조정 도구가 함께 경쟁해요실제 도입 비용과 공급자 변경 가능성은 주변 도구에서 크게 갈려요오픈 웨이트학습된 가중치는 내려받아 수정할 수 있지만 학습 데이터와 전체 과정은 대개 공개되지 않아요오픈 소스 ..
Inkling 공개, 975B 오픈 웨이트 모델이 성능보다 맞춤화를 택한 이유 Inkling 공개, 975B 오픈 웨이트 모델이 성능보다 맞춤화를 택한 이유AI 뉴스 썸네일Thinking Machines Lab이 첫 자체 모델 Inkling의 전체 가중치를 공개했어요. 가장 높은 종합 점수를 내세우기보다 긴 문맥, 멀티모달 입력, 조절할 수 있는 추론 비용과 미세조정 생태계를 한 모델에 묶은 점이 눈에 띄어요. 1핵심 요약구분핵심왜 볼 만한가요모델 규모총 975B, 토큰당 활성 41B인 MoE 모델이에요큰 전체 용량과 상대적으로 낮은 활성량을 함께 노렸어요입력과 문맥텍스트·이미지·오디오를 처리하고 최대 1M 토큰을 지원해요긴 작업 기록과 여러 입력 형식을 한 흐름에서 다룰 수 있어요비용 조절추론 노력도를 0.2부터 0.99까지 설정할 수 있어요호출 비용과 응답 시간을 용도별로 조절..
AMD Ryzen AI Halo는 로컬 AI 개발 키트의 기준을 묻고 있어요 AMD Ryzen AI Halo는 로컬 AI 개발 키트의 기준을 묻고 있어요AI 뉴스 썸네일로컬에서 LLM을 돌리는 일은 이제 특별한 취미가 아니에요. 문제는 하드웨어를 고르고, 드라이버를 맞추고, 모델과 런타임을 연결하는 과정이 여전히 번거롭다는 점이에요. AMD Ryzen AI Halo는 성능만 내세우는 미니 PC라기보다, AMD 하드웨어로 AI 개발을 시작할 때 필요한 기준 환경을 묶어 파는 제품에 가까워요.핵심 요약구분핵심왜 볼만한가요로컬 AI 하드웨어Ryzen AI Max+ 395, 128GB 통합 메모리, 2TB SSD를 한 구성으로 묶었어요로컬 LLM 실험용 장비를 직접 조립하지 않아도 시작점을 잡을 수 있어요성능 비교llama-bench에서는 Apple Silicon Mac Studio가 ..

728x90