본문 바로가기

728x90

huggingface

(24)
내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To Speech 내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To SpeechAI 뉴스 썸네일말을 듣고 답하는 AI를 만들려면 음성 감지, 받아쓰기, 답변 생성, 음성 합성을 차례로 연결해야 해요. Hugging Face의 Speech To Speech는 이 과정을 한 파이프라인으로 묶고, 각 부품을 원하는 모델로 바꿀 수 있게 만든 오픈소스 프로젝트예요. 1핵심 요약구분내용처리 구조VAD, STT, LLM, TTS가 각각 별도 스레드에서 움직이고 큐로 데이터를 넘겨요.연결 방식OpenAI Realtime의 핵심 이벤트를 WebSocket과 WebRTC로 제공해요.모델 선택STT, LLM, TTS를 하드웨어와 언어에 맞춰 교체할 수 있어요.로컬 실행llama.cpp, vLLM, MLX LM 같은..
Qwen3.8 27B 지능 지수 52점, 점수보다 토큰 사용량을 함께 봐야 해요 Qwen3.8 27B 지능 지수 52점, 점수보다 토큰 사용량을 함께 봐야 해요AI 뉴스 썸네일Qwen3.8 27B가 Artificial Analysis Intelligence Index에서 52점을 받았어요. 같은 규모의 오픈 가중치 모델 중앙값 9보다 높지만, 평가에 쓴 출력 토큰도 1억 6,000만 개로 중앙값보다 약 3.7배 많았어요. 모델을 고를 때는 점수와 함께 응답 길이, 속도, 실제 운영 비용을 확인해야 해요. 1핵심 요약구분내용평가 결과Artificial Analysis Intelligence Index 52점을 기록했어요. 같은 규모의 오픈 가중치 모델 중앙값은 9점이에요.토큰 사용전체 평가에서 출력 토큰 1억 6,000만 개를 생성했어요. 비교군 중앙값 4,300만 개보다 약 3.7배..
Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요 Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요Qwen 3.8 27B AI 모델 썸네일Qwen이 270억 파라미터 규모의 멀티모달 모델 Qwen3.8-27B와 FP8 가중치를 공개했어요. 이미지와 영상을 읽고, 코딩이나 긴 작업을 여러 단계로 이어가는 용도를 한 모델에서 다뤄요. 개발자는 Hugging Face에서 가중치를 내려받아 자체 환경에 배치할 수 있어요. 2핵심 요약구분내용모델270억 파라미터의 밀집형 비전·언어 모델이에요.배포판블록 크기 128을 적용한 FP8 가중치를 Apache 2.0 라이선스로 제공해요.문맥기본 262,144 토큰이며 YaRN 설정으로 최대 100만 토큰까지 늘릴 수 있어요.추론 제어사고 모드를 끄거나 `reasoning_effort`를 ..
2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요 2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요AI 뉴스 썸네일Qwen이 2.4조 파라미터 규모의 Qwen3.8-2.4T-A95B 가중치를 공개했어요. 기업이 Qwen의 Max급 모델을 자체 인프라에서 운영할 길이 열렸지만, 막대한 GPU 자원과 별도 상업 조건까지 함께 따져야 해요. 1핵심 요약구분핵심왜 볼만한가요모델 규모전체 2.4조 파라미터 가운데 토큰마다 950억 파라미터를 써요거대한 모델의 성능을 MoE 구조로 나눠 쓰지만, 운영 규모는 여전히 데이터센터급이에요작업 방식계획, 도구 사용, 결과 확인, 재시도를 잇는 장기 작업에 초점을 맞췄어요단발성 답변보다 코딩과 연구 업무를 끝까지 처리하는 능력을 겨냥했어요실행 환경Transformers, vLLM, SGLang, ..
H3-metal, MiniMax-H3 영상 생성을 애플 실리콘에 맞추다 H3-metal, MiniMax-H3 영상 생성을 애플 실리콘에 맞추다H3-metal MiniMax-H3 애플 실리콘 추론 엔진 썸네일AI 영상 생성은 빠른 GPU와 큰 메모리를 요구해 클라우드나 고성능 그래픽카드에 기대는 경우가 많아요. H3-metal은 MiniMax-H3의 영상·오디오 생성을 애플 실리콘 Mac에서 직접 돌리도록 만든 추론 엔진이에요. 범용 호환보다 Metal 최적화와 메모리 운용에 집중했어요. 1핵심 요약구분내용실행 환경C, Objective-C, Metal로 구현한 애플 실리콘용 MiniMax-H3 추론 엔진이에요.생성 기능텍스트에서 영상과 오디오를 만들고, 첫·마지막 프레임과 여러 미디어 참조도 받을 수 있어요.성능 선택디노이징 횟수, DiT 블록 수, 내부 해상도, 계산 재사..
Meta가 다시 꺼낸 공개 가중치 AI, 약속보다 조건을 봐야 해요 Meta가 다시 꺼낸 공개 가중치 AI, 약속보다 조건을 봐야 해요AI 뉴스 썸네일Meta가 Muse Glimmer의 가중치를 공개하고, 더 강한 Muse Spark도 수주 안에 내놓겠다고 밝혔어요. 마크 저커버그는 AI 능력을 소수 기업과 정부가 쥐는 것보다 개인에게 넓게 배포하는 편이 안전과 혁신에 도움이 된다고 주장했어요. 다만 가중치를 받을 수 있다는 사실만으로 사용 권리와 재배포 조건까지 열린 것은 아니에요.핵심 요약구분핵심왜 볼 만한가요모델 공개Muse Glimmer 가중치를 공개했고 Muse Spark 공개도 예고했어요개발자가 모델을 직접 내려받아 수정할 선택지가 늘어요경쟁 구도Meta는 폐쇄형 모델 중심의 경쟁사를 공개적으로 비판했어요모델 성능뿐 아니라 접근권과 배포 방식이 경쟁 기준으로 ..
20GB 안으로 들어온 30B 코딩 모델, Meta Muse Glimmer 20GB 안으로 들어온 30B 코딩 모델, Meta Muse GlimmerAI 뉴스 썸네일Meta가 30B 파라미터 로컬 코딩 모델 Muse Glimmer를 공개했어요. 약 4비트로 양자화한 모델은 20GB보다 작아서 24GB나 32GB 메모리를 갖춘 Mac·PC에서 에이전트 작업을 돌리는 구성을 겨냥해요. 1핵심 요약구분핵심왜 볼 만한가요공개 방식30B 모델 가중치를 Apache 2.0 라이선스로 공개했어요사용 조건이 비교적 명확한 오픈 웨이트 코딩 모델 선택지가 늘었어요로컬 실행약 4비트 양자화로 모델 크기를 20GB 미만으로 줄였어요24GB·32GB급 소비자 하드웨어에서 로컬 에이전트를 구성할 수 있어요작업 범위함수 호출, 코드 작성·디버깅, 도구 오류 복구, 이미지 입력을 다뤄요단순 코드 완성보다..
MiniMax H3가 ComfyUI에 들어왔어요: 영상·오디오 생성과 로컬 실행의 조건 MiniMax H3가 ComfyUI에 들어왔어요: 영상·오디오 생성과 로컬 실행의 조건AI 뉴스 썸네일MiniMax H3가 공개되자 ComfyUI가 곧바로 공식 워크플로를 내놨어요. 영상과 스테레오 오디오를 같은 생성 과정에서 만들고, 텍스트·이미지·참조 영상까지 한 모델에서 다룬다는 점이 눈에 띄어요. 다만 2K 전체 과정과 한국에서의 이용 조건은 별도로 확인해야 해요.핵심 요약구분핵심왜 볼 만한가요생성 기능최대 15초 영상과 32kHz 스테레오 오디오를 함께 생성해요영상 생성 뒤 음향을 따로 붙이는 작업을 줄일 수 있어요입력 방식텍스트, 시작·종료 프레임, 이미지·영상·오디오 참조를 받아요한 그래프에서 장면 생성과 참조 기반 수정을 이어갈 수 있어요로컬 실행ComfyUI가 가지치기·양자화 모델과 VR..
크래프톤 A.X K2 Raon-Speech 공개, 한국어 음성 AI를 하나의 모델로 크래프톤 A.X K2 Raon-Speech 공개, 한국어 음성 AI를 하나의 모델로AI 뉴스 썸네일크래프톤이 한국어와 영어를 다루는 음성 언어 모델 A.X K2 Raon-Speech를 공개했어요. 음성을 글로 바꾸는 STT와 글을 음성으로 읽는 TTS부터 음성 질의응답, 도구 호출까지 하나의 모델에서 처리해요. 한국어 음성 AI를 직접 시험하려는 개발팀이 모델 구조와 가중치, 실행 조건을 함께 살펴볼 수 있는 공개 모델이에요. 2핵심 요약구분핵심왜 볼 만한가요모델 규모전체 21.2B 가운데 약 3.5B 파라미터를 활성화하는 MoE 모델이에요큰 전체 용량과 실제 추론에 쓰는 활성 파라미터를 나눠 설계했어요음성 기능STT, TTS, SpeechQA, SpokenQA, 음성 대화를 한 모델에서 지원해요여러 음..
카카오가 공개한 경량 언어모델 Kanana-2, 1.3B로 32K 문맥까지 카카오가 공개한 경량 언어모델 Kanana-2, 1.3B로 32K 문맥까지AI 뉴스 썸네일카카오가 Kanana-2 SLM의 3B와 1.3B 모델을 Base와 Instruct 두 형태로 공개했어요. 작은 모델을 기기나 제한된 서버 자원에서 쓸 때 중요한 한국어 토큰 효율, 긴 문맥, KV 캐시 사용량을 함께 다듬은 공개 모델이에요. 2핵심 요약구분핵심왜 볼 만한가요공개 모델3B와 1.3B의 Base, Instruct 가중치 4종을 공개했어요사전학습용 모델과 대화·지시 수행용 모델을 목적에 맞게 고를 수 있어요모델 압축3B 모델을 단계적으로 가지치기하고 증류해 1.3B 모델을 만들었어요처음부터 작은 모델을 따로 학습하는 방식과 다른 압축 과정을 확인할 수 있어요긴 문맥1.3B 모델이 최대 32,768토큰을 ..

728x90