본문 바로가기

728x90

SGLang

(9)
Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요 Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요Qwen 3.8 27B AI 모델 썸네일Qwen이 270억 파라미터 규모의 멀티모달 모델 Qwen3.8-27B와 FP8 가중치를 공개했어요. 이미지와 영상을 읽고, 코딩이나 긴 작업을 여러 단계로 이어가는 용도를 한 모델에서 다뤄요. 개발자는 Hugging Face에서 가중치를 내려받아 자체 환경에 배치할 수 있어요. 2핵심 요약구분내용모델270억 파라미터의 밀집형 비전·언어 모델이에요.배포판블록 크기 128을 적용한 FP8 가중치를 Apache 2.0 라이선스로 제공해요.문맥기본 262,144 토큰이며 YaRN 설정으로 최대 100만 토큰까지 늘릴 수 있어요.추론 제어사고 모드를 끄거나 `reasoning_effort`를 ..
Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실 Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실Qwen3.8 로컬 실행 썸네일Unsloth가 Qwen3.8-2.4T-A95B를 397GB까지 줄인 GGUF와 실행 가이드를 공개했어요. 4.9TB에 이르는 BF16 모델보다 91% 작지만, 일반 노트북에서 가볍게 돌리는 모델은 아니에요. 수백 GB 메모리를 갖춘 워크스테이션에서 초대형 MoE 모델을 직접 운영할 길을 연 사례에 가까워요. 1핵심 요약구분공개된 내용실제 의미모델 구조전체 2.4조 파라미터, 토큰당 950억 파라미터 활성화모든 가중치를 매번 계산하지 않는 MoE 모델이에요저장·메모리 규모BF16 4.9TB, Dynamic 1-bit XXXS 397GB91% 줄었어도 고사양 워크스테이션이 필요해요중간 선택지1-bit ..
2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요 2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요AI 뉴스 썸네일Qwen이 2.4조 파라미터 규모의 Qwen3.8-2.4T-A95B 가중치를 공개했어요. 기업이 Qwen의 Max급 모델을 자체 인프라에서 운영할 길이 열렸지만, 막대한 GPU 자원과 별도 상업 조건까지 함께 따져야 해요. 1핵심 요약구분핵심왜 볼만한가요모델 규모전체 2.4조 파라미터 가운데 토큰마다 950억 파라미터를 써요거대한 모델의 성능을 MoE 구조로 나눠 쓰지만, 운영 규모는 여전히 데이터센터급이에요작업 방식계획, 도구 사용, 결과 확인, 재시도를 잇는 장기 작업에 초점을 맞췄어요단발성 답변보다 코딩과 연구 업무를 끝까지 처리하는 능력을 겨냥했어요실행 환경Transformers, vLLM, SGLang, ..
MiniMax H3가 ComfyUI에 들어왔어요: 영상·오디오 생성과 로컬 실행의 조건 MiniMax H3가 ComfyUI에 들어왔어요: 영상·오디오 생성과 로컬 실행의 조건AI 뉴스 썸네일MiniMax H3가 공개되자 ComfyUI가 곧바로 공식 워크플로를 내놨어요. 영상과 스테레오 오디오를 같은 생성 과정에서 만들고, 텍스트·이미지·참조 영상까지 한 모델에서 다룬다는 점이 눈에 띄어요. 다만 2K 전체 과정과 한국에서의 이용 조건은 별도로 확인해야 해요.핵심 요약구분핵심왜 볼 만한가요생성 기능최대 15초 영상과 32kHz 스테레오 오디오를 함께 생성해요영상 생성 뒤 음향을 따로 붙이는 작업을 줄일 수 있어요입력 방식텍스트, 시작·종료 프레임, 이미지·영상·오디오 참조를 받아요한 그래프에서 장면 생성과 참조 기반 수정을 이어갈 수 있어요로컬 실행ComfyUI가 가지치기·양자화 모델과 VR..
Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요 Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요AI 뉴스 썸네일2.8조 매개변수 규모의 Kimi K3를 AMD MI355X 8개로 구성한 한 노드에서 구동한 결과가 나왔어요. 엔비디아 B300이 절대 처리량에서는 빨랐지만, Wafer가 적용한 시간당 대여료로 계산하면 MI355X가 달러당 처리량에서 앞섰어요. 1핵심 요약구분핵심왜 볼 만한가요메모리 구성MI355X는 GPU당 288GB VRAM으로 Kimi K3와 100만 토큰 KV 캐시를 8개 GPU 한 노드에 담았어요초대형 모델은 연산 속도뿐 아니라 한 노드에 들어가는지가 비용과 통신량을 바꿔요처리량MI355X는 총 952 tok/s와 단일 스트림 118 tok/s를 기록했어요B200 두 노드 구성보다 노드당 처리..
Kimi K3 가중치 공개, 2.8조 파라미터 모델을 직접 배포할 수 있어요 Kimi K3 가중치 공개, 2.8조 파라미터 모델을 직접 배포할 수 있어요Kimi K3 Hugging Face 공개 썸네일Moonshot AI가 Kimi K3의 전체 가중치와 실행 코드를 Hugging Face에 공개했어요. 2.8조 개 파라미터, 104만 8,576 토큰 컨텍스트, 이미지와 영상을 다루는 멀티모달 기능을 한 모델에 담았어요. 이제 발표 자료를 보는 단계를 넘어 라이선스와 배포 조건을 직접 확인할 수 있어요. 1핵심 요약구분핵심왜 볼 만한가요공개 범위모델 가중치와 실행 코드가 Hugging Face에 올라왔어요연구팀과 기업이 자체 환경에서 모델을 시험하고 수정할 수 있어요모델 구조전체 2.8조 개 중 토큰마다 1,040억 개 파라미터를 활성화해요전체 규모와 한 번의 추론에 쓰는 계산량을..
오픈 웨이트 AI, 모델보다 생태계 경쟁이 중요해졌어요 오픈 웨이트 AI, 모델보다 생태계 경쟁이 중요해졌어요IT & AI 뉴스 썸네일오픈 웨이트 AI의 경쟁 기준이 모델 한 개의 성능에서 그 주변의 도구와 운영 체계로 넓어지고 있어요. Kubernetes가 공통 기반 위에 네트워킹, 스토리지, 관측성 도구를 키웠듯이 AI에서도 모델 서빙과 미세조정, 평가, 런타임이 하나의 생태계로 묶이는 흐름이에요. 다만 모델 가중치를 공개하는 것과 완전한 오픈 소스는 구분해서 봐야 해요. 1핵심 요약구분핵심왜 볼만한가요경쟁 단위모델 성능뿐 아니라 서빙, 평가, 관측성, 미세조정 도구가 함께 경쟁해요실제 도입 비용과 공급자 변경 가능성은 주변 도구에서 크게 갈려요오픈 웨이트학습된 가중치는 내려받아 수정할 수 있지만 학습 데이터와 전체 과정은 대개 공개되지 않아요오픈 소스 ..
Inkling 공개, 975B 오픈 웨이트 모델이 성능보다 맞춤화를 택한 이유 Inkling 공개, 975B 오픈 웨이트 모델이 성능보다 맞춤화를 택한 이유AI 뉴스 썸네일Thinking Machines Lab이 첫 자체 모델 Inkling의 전체 가중치를 공개했어요. 가장 높은 종합 점수를 내세우기보다 긴 문맥, 멀티모달 입력, 조절할 수 있는 추론 비용과 미세조정 생태계를 한 모델에 묶은 점이 눈에 띄어요. 1핵심 요약구분핵심왜 볼 만한가요모델 규모총 975B, 토큰당 활성 41B인 MoE 모델이에요큰 전체 용량과 상대적으로 낮은 활성량을 함께 노렸어요입력과 문맥텍스트·이미지·오디오를 처리하고 최대 1M 토큰을 지원해요긴 작업 기록과 여러 입력 형식을 한 흐름에서 다룰 수 있어요비용 조절추론 노력도를 0.2부터 0.99까지 설정할 수 있어요호출 비용과 응답 시간을 용도별로 조절..
AI 추론 비용 싸움에 AMD MI355X가 끼어들었어요 AI 추론 비용 싸움에 AMD MI355X가 끼어들었어요AI 뉴스 썸네일AI 모델을 쓰는 비용은 모델 품질만큼이나 인프라 선택에 크게 좌우돼요. Wafer는 GLM-5.2를 AMD MI355X에서 돌리며, NVIDIA Blackwell보다 낮은 장비 비용으로 꽤 가까운 추론 처리량을 낼 수 있다고 주장했어요. 핵심은 GPU 가격보다 CUDA와 ROCm 사이의 소프트웨어 격차를 얼마나 줄일 수 있느냐예요.핵심 요약구분핵심왜 볼 만한가요AI 인프라Wafer는 AMD MI355X가 B300보다 GPU당 평균 약 2.75배 저렴하다고 설명해요추론 수요가 늘수록 모델 제공사의 원가 구조가 서비스 가격에 바로 영향을 줘요성능 테스트GLM-5.2 워크로드에서 2626 tok/s/node와 2.4 rps를 기록했어요B..

728x90