본문 바로가기

728x90

vllm

(11)
내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To Speech 내 컴퓨터에서 음성 AI를 돌리는 Hugging Face Speech To SpeechAI 뉴스 썸네일말을 듣고 답하는 AI를 만들려면 음성 감지, 받아쓰기, 답변 생성, 음성 합성을 차례로 연결해야 해요. Hugging Face의 Speech To Speech는 이 과정을 한 파이프라인으로 묶고, 각 부품을 원하는 모델로 바꿀 수 있게 만든 오픈소스 프로젝트예요. 1핵심 요약구분내용처리 구조VAD, STT, LLM, TTS가 각각 별도 스레드에서 움직이고 큐로 데이터를 넘겨요.연결 방식OpenAI Realtime의 핵심 이벤트를 WebSocket과 WebRTC로 제공해요.모델 선택STT, LLM, TTS를 하드웨어와 언어에 맞춰 교체할 수 있어요.로컬 실행llama.cpp, vLLM, MLX LM 같은..
Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요 Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요Qwen 3.8 27B AI 모델 썸네일Qwen이 270억 파라미터 규모의 멀티모달 모델 Qwen3.8-27B와 FP8 가중치를 공개했어요. 이미지와 영상을 읽고, 코딩이나 긴 작업을 여러 단계로 이어가는 용도를 한 모델에서 다뤄요. 개발자는 Hugging Face에서 가중치를 내려받아 자체 환경에 배치할 수 있어요. 2핵심 요약구분내용모델270억 파라미터의 밀집형 비전·언어 모델이에요.배포판블록 크기 128을 적용한 FP8 가중치를 Apache 2.0 라이선스로 제공해요.문맥기본 262,144 토큰이며 YaRN 설정으로 최대 100만 토큰까지 늘릴 수 있어요.추론 제어사고 모드를 끄거나 `reasoning_effort`를 ..
Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실 Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실Qwen3.8 로컬 실행 썸네일Unsloth가 Qwen3.8-2.4T-A95B를 397GB까지 줄인 GGUF와 실행 가이드를 공개했어요. 4.9TB에 이르는 BF16 모델보다 91% 작지만, 일반 노트북에서 가볍게 돌리는 모델은 아니에요. 수백 GB 메모리를 갖춘 워크스테이션에서 초대형 MoE 모델을 직접 운영할 길을 연 사례에 가까워요. 1핵심 요약구분공개된 내용실제 의미모델 구조전체 2.4조 파라미터, 토큰당 950억 파라미터 활성화모든 가중치를 매번 계산하지 않는 MoE 모델이에요저장·메모리 규모BF16 4.9TB, Dynamic 1-bit XXXS 397GB91% 줄었어도 고사양 워크스테이션이 필요해요중간 선택지1-bit ..
2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요 2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요AI 뉴스 썸네일Qwen이 2.4조 파라미터 규모의 Qwen3.8-2.4T-A95B 가중치를 공개했어요. 기업이 Qwen의 Max급 모델을 자체 인프라에서 운영할 길이 열렸지만, 막대한 GPU 자원과 별도 상업 조건까지 함께 따져야 해요. 1핵심 요약구분핵심왜 볼만한가요모델 규모전체 2.4조 파라미터 가운데 토큰마다 950억 파라미터를 써요거대한 모델의 성능을 MoE 구조로 나눠 쓰지만, 운영 규모는 여전히 데이터센터급이에요작업 방식계획, 도구 사용, 결과 확인, 재시도를 잇는 장기 작업에 초점을 맞췄어요단발성 답변보다 코딩과 연구 업무를 끝까지 처리하는 능력을 겨냥했어요실행 환경Transformers, vLLM, SGLang, ..
MiniMax H3가 ComfyUI에 들어왔어요: 영상·오디오 생성과 로컬 실행의 조건 MiniMax H3가 ComfyUI에 들어왔어요: 영상·오디오 생성과 로컬 실행의 조건AI 뉴스 썸네일MiniMax H3가 공개되자 ComfyUI가 곧바로 공식 워크플로를 내놨어요. 영상과 스테레오 오디오를 같은 생성 과정에서 만들고, 텍스트·이미지·참조 영상까지 한 모델에서 다룬다는 점이 눈에 띄어요. 다만 2K 전체 과정과 한국에서의 이용 조건은 별도로 확인해야 해요.핵심 요약구분핵심왜 볼 만한가요생성 기능최대 15초 영상과 32kHz 스테레오 오디오를 함께 생성해요영상 생성 뒤 음향을 따로 붙이는 작업을 줄일 수 있어요입력 방식텍스트, 시작·종료 프레임, 이미지·영상·오디오 참조를 받아요한 그래프에서 장면 생성과 참조 기반 수정을 이어갈 수 있어요로컬 실행ComfyUI가 가지치기·양자화 모델과 VR..
Kimi K3 가중치 공개, 2.8조 파라미터 모델을 직접 배포할 수 있어요 Kimi K3 가중치 공개, 2.8조 파라미터 모델을 직접 배포할 수 있어요Kimi K3 Hugging Face 공개 썸네일Moonshot AI가 Kimi K3의 전체 가중치와 실행 코드를 Hugging Face에 공개했어요. 2.8조 개 파라미터, 104만 8,576 토큰 컨텍스트, 이미지와 영상을 다루는 멀티모달 기능을 한 모델에 담았어요. 이제 발표 자료를 보는 단계를 넘어 라이선스와 배포 조건을 직접 확인할 수 있어요. 1핵심 요약구분핵심왜 볼 만한가요공개 범위모델 가중치와 실행 코드가 Hugging Face에 올라왔어요연구팀과 기업이 자체 환경에서 모델을 시험하고 수정할 수 있어요모델 구조전체 2.8조 개 중 토큰마다 1,040억 개 파라미터를 활성화해요전체 규모와 한 번의 추론에 쓰는 계산량을..
넷플릭스는 vLLM을 어떻게 프로덕션에 올렸을까요 넷플릭스는 vLLM을 어떻게 프로덕션에 올렸을까요AI 뉴스 썸네일넷플릭스가 사내 LLM 서빙 플랫폼의 구조와 운영 경험을 공개했어요. vLLM을 고르는 데서 끝나지 않고, 기존 ML 인프라와 연결한 방식부터 무중단 배포, 메트릭 통합, 제약 디코딩 병목까지 구체적으로 다뤘어요. 1핵심 요약구분핵심왜 볼 만한가요서빙 구조기존 JVM 서빙 계층과 Triton 위에 vLLM을 연결했어요LLM만을 위한 별도 운영 체계를 만들지 않고 기존 배포·상태 확인·자동 확장 기능을 재사용했어요엔진 선택TensorRT-LLM에서 vLLM을 기본 경로로 바꿨어요최고 처리량 하나보다 사용자 정의 모델, 디버깅, 확장 훅, 연구 환경과의 연결 비용을 함께 봤어요APIgRPC와 OpenAI 호환 HTTP API를 함께 열었어요기존..
오픈 웨이트 AI, 모델보다 생태계 경쟁이 중요해졌어요 오픈 웨이트 AI, 모델보다 생태계 경쟁이 중요해졌어요IT & AI 뉴스 썸네일오픈 웨이트 AI의 경쟁 기준이 모델 한 개의 성능에서 그 주변의 도구와 운영 체계로 넓어지고 있어요. Kubernetes가 공통 기반 위에 네트워킹, 스토리지, 관측성 도구를 키웠듯이 AI에서도 모델 서빙과 미세조정, 평가, 런타임이 하나의 생태계로 묶이는 흐름이에요. 다만 모델 가중치를 공개하는 것과 완전한 오픈 소스는 구분해서 봐야 해요. 1핵심 요약구분핵심왜 볼만한가요경쟁 단위모델 성능뿐 아니라 서빙, 평가, 관측성, 미세조정 도구가 함께 경쟁해요실제 도입 비용과 공급자 변경 가능성은 주변 도구에서 크게 갈려요오픈 웨이트학습된 가중치는 내려받아 수정할 수 있지만 학습 데이터와 전체 과정은 대개 공개되지 않아요오픈 소스 ..
Inkling 공개, 975B 오픈 웨이트 모델이 성능보다 맞춤화를 택한 이유 Inkling 공개, 975B 오픈 웨이트 모델이 성능보다 맞춤화를 택한 이유AI 뉴스 썸네일Thinking Machines Lab이 첫 자체 모델 Inkling의 전체 가중치를 공개했어요. 가장 높은 종합 점수를 내세우기보다 긴 문맥, 멀티모달 입력, 조절할 수 있는 추론 비용과 미세조정 생태계를 한 모델에 묶은 점이 눈에 띄어요. 1핵심 요약구분핵심왜 볼 만한가요모델 규모총 975B, 토큰당 활성 41B인 MoE 모델이에요큰 전체 용량과 상대적으로 낮은 활성량을 함께 노렸어요입력과 문맥텍스트·이미지·오디오를 처리하고 최대 1M 토큰을 지원해요긴 작업 기록과 여러 입력 형식을 한 흐름에서 다룰 수 있어요비용 조절추론 노력도를 0.2부터 0.99까지 설정할 수 있어요호출 비용과 응답 시간을 용도별로 조절..
AI 답변 한 줄이 데이터센터를 통과하는 15단계 AI 답변 한 줄이 데이터센터를 통과하는 15단계AI 뉴스 썸네일AI 서비스에 질문을 보내면 화면에는 글자가 한 토큰씩 나타나요. 그 짧은 시간에 요청은 인증과 라우팅을 거쳐 GPU에 배치되고, GPU 메모리와 서버 간 연결망을 통과해요. 답변 속도와 비용은 모델 크기만으로 정해지지 않아요. 캐시 적중률, 메모리 대역폭, 배치 방식, 네트워크 혼잡까지 함께 작용해요. 1핵심 요약구분실제로 일어나는 일서비스 운영에서 볼 지점요청 진입토큰화, 인증, 과금 등급 확인, 부하 분산을 거쳐요요청 제한과 캐시 친화적 라우팅이 초기 비용을 바꿔요프리필입력 토큰을 병렬로 읽고 KV 캐시를 만들어요입력 길이와 연산량이 첫 토큰 대기시간에 영향을 줘요디코드이전 결과를 참고해 다음 토큰을 하나씩 만들어요HBM 대역폭과 출력..

728x90