본문 바로가기

728x90

Moe

(12)
추론은 강해졌는데 사실은 자주 틀려요, 소형 AI 모델의 새로운 절충 추론은 강해졌는데 사실은 자주 틀려요, 소형 AI 모델의 새로운 절충AI 뉴스 썸네일요즘 소형 LLM은 수학과 코딩 문제를 꽤 잘 풀어요. 그런데 인물의 생년이나 특정 라이브러리 버전처럼 세부 사실을 물으면 자신 있게 틀리는 경우가 많아요. 모델을 작게 만드는 과정에서 무엇을 기억하고 무엇을 외부 자료에 맡길지 다시 따져볼 시점이에요. 1핵심 요약구분핵심왜 볼 만한가요성능 변화적은 활성 매개변수로 높은 추론 점수를 내는 모델이 늘고 있어요모델 크기와 문제 해결 능력의 관계가 달라지고 있어요약점도구 없이 세부 사실을 회상할 때 오답과 환각이 많아요벤치마크 점수만으로 실제 답변 품질을 판단하기 어려워요설계 방향최신 세부 정보는 검색, 문서, 도구 호출로 가져오는 방안이 거론돼요오래된 API나 가격 정보를 가..
Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실 Qwen3.8 2.4T를 397GB로 줄인 Unsloth, 로컬 실행의 현실Qwen3.8 로컬 실행 썸네일Unsloth가 Qwen3.8-2.4T-A95B를 397GB까지 줄인 GGUF와 실행 가이드를 공개했어요. 4.9TB에 이르는 BF16 모델보다 91% 작지만, 일반 노트북에서 가볍게 돌리는 모델은 아니에요. 수백 GB 메모리를 갖춘 워크스테이션에서 초대형 MoE 모델을 직접 운영할 길을 연 사례에 가까워요. 1핵심 요약구분공개된 내용실제 의미모델 구조전체 2.4조 파라미터, 토큰당 950억 파라미터 활성화모든 가중치를 매번 계산하지 않는 MoE 모델이에요저장·메모리 규모BF16 4.9TB, Dynamic 1-bit XXXS 397GB91% 줄었어도 고사양 워크스테이션이 필요해요중간 선택지1-bit ..
2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요 2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요AI 뉴스 썸네일Qwen이 2.4조 파라미터 규모의 Qwen3.8-2.4T-A95B 가중치를 공개했어요. 기업이 Qwen의 Max급 모델을 자체 인프라에서 운영할 길이 열렸지만, 막대한 GPU 자원과 별도 상업 조건까지 함께 따져야 해요. 1핵심 요약구분핵심왜 볼만한가요모델 규모전체 2.4조 파라미터 가운데 토큰마다 950억 파라미터를 써요거대한 모델의 성능을 MoE 구조로 나눠 쓰지만, 운영 규모는 여전히 데이터센터급이에요작업 방식계획, 도구 사용, 결과 확인, 재시도를 잇는 장기 작업에 초점을 맞췄어요단발성 답변보다 코딩과 연구 업무를 끝까지 처리하는 능력을 겨냥했어요실행 환경Transformers, vLLM, SGLang, ..
크래프톤 A.X K2 Raon-Speech 공개, 한국어 음성 AI를 하나의 모델로 크래프톤 A.X K2 Raon-Speech 공개, 한국어 음성 AI를 하나의 모델로AI 뉴스 썸네일크래프톤이 한국어와 영어를 다루는 음성 언어 모델 A.X K2 Raon-Speech를 공개했어요. 음성을 글로 바꾸는 STT와 글을 음성으로 읽는 TTS부터 음성 질의응답, 도구 호출까지 하나의 모델에서 처리해요. 한국어 음성 AI를 직접 시험하려는 개발팀이 모델 구조와 가중치, 실행 조건을 함께 살펴볼 수 있는 공개 모델이에요. 2핵심 요약구분핵심왜 볼 만한가요모델 규모전체 21.2B 가운데 약 3.5B 파라미터를 활성화하는 MoE 모델이에요큰 전체 용량과 실제 추론에 쓰는 활성 파라미터를 나눠 설계했어요음성 기능STT, TTS, SpeechQA, SpokenQA, 음성 대화를 한 모델에서 지원해요여러 음..
Kimi K3 2.78조 모델을 64GB 맥북에서 돌린 WASTE Kimi K3 2.78조 모델을 64GB 맥북에서 돌린 WASTEKimi K3 로컬 추론 썸네일2.78조 파라미터 규모의 Kimi K3를 64GB MacBook Pro에서 실행한 오픈소스 프로젝트가 나왔어요. WASTE는 모델 전체를 메모리에 올리는 대신, 토큰 생성에 필요한 전문가 가중치만 NVMe에서 읽어요. 속도는 빠르지 않지만 초대형 MoE 모델을 개인용 하드웨어에서 구동하는 방법을 구체적인 수치로 보여줘요. 1핵심 요약구분내용실제 의미모델Kimi K3 2.78조 파라미터 전체 모델증류하거나 가지치기한 축소판이 아니에요저장공간변환된 컨테이너 982GiB내부 NVMe에 약 1TB 여유 공간이 필요해요메모리4K 컨텍스트 최소 29.05GiB, 권장 구성 64GB최소치로 열 수는 있어도 운영체제 페이징..
DeepSeek V4 Flash 0731, 50점 성능과 낮은 API 가격의 조건 DeepSeek V4 Flash 0731, 50점 성능과 낮은 API 가격의 조건AI 뉴스 썸네일DeepSeek V4 Flash 0731은 성능 점수와 API 가격을 함께 봐야 성격이 드러나요. Artificial Analysis 평가에서는 상위권에 올랐고, 입력과 출력 가격은 비교군 중앙값보다 낮았어요. 다만 많은 출력 토큰을 쓴 만큼 실제 서비스 비용과 응답 시간은 업무별로 따져봐야 해요. 1핵심 요약구분확인된 내용실무에서 볼 부분지능 평가Intelligence Index v4.1에서 50점, 101개 모델 중 3위한 개 종합지수이므로 실제 업무와 맞는 세부 평가도 확인해야 해요모델 구조전체 2,840억 파라미터 중 토큰마다 130억 개를 활성화하는 MoE전체 규모와 실제 추론 연산량을 구분해 봐야 ..
Kimi K3를 로컬에서 돌리려면 메모리가 얼마나 필요할까요 Kimi K3를 로컬에서 돌리려면 메모리가 얼마나 필요할까요Kimi K3 로컬 실행 썸네일Moonshot AI의 Kimi K3는 오픈 웨이트 모델이지만, 개인용 PC 한 대에 가볍게 올릴 수 있는 크기는 아니에요. Unsloth가 공개한 가장 작은 권장 양자화도 파일이 594GB이고, 실행에는 RAM과 VRAM을 합쳐 최소 610GB가 필요해요. 로컬 실행에서 말하는 ‘로컬’이 고성능 워크스테이션이나 여러 장의 GPU를 포함한다는 점부터 확인해야 해요. 1핵심 요약구분확인할 내용실제 의미모델 규모전체 2.8조, 추론 시 1,040억 매개변수 활성화MoE 구조여도 저장 공간과 메모리 요구량은 매우 커요가장 작은 권장 양자화`UD-IQ1_S` 594GB실행 환경에는 최소 610GB의 총 메모리가 필요해요품질..
8GB 맥에서 26B 모델을 돌린 TurboFieldfare의 SSD 스트리밍 설계 8GB 맥에서 26B 모델을 돌린 TurboFieldfare의 SSD 스트리밍 설계TurboFieldfare AI 뉴스 썸네일26B급 언어 모델은 메모리가 작은 맥에서 실행하기 어렵다는 인식이 익숙해요. TurboFieldfare는 Gemma 4 26B-A4B의 가중치 전체를 메모리에 올리는 대신, 토큰 생성에 필요한 부분만 SSD에서 읽어 이 제약을 피했어요. 개발자가 공개한 측정값에 따르면 8GB M2 MacBook Air에서도 초당 5.1~6.3토큰으로 텍스트를 생성해요. 1핵심 요약구분핵심확인할 점메모리약 14.3GB 모델 가운데 공유 코어와 KV 캐시 등 약 2GB만 메모리에 둬요모델 파일을 저장할 약 15GB 공간은 따로 필요해요실행 구조토큰마다 선택된 MoE 전문가 가중치를 SSD에서 읽어요..
Kimi K3 가중치 공개, 2.8조 파라미터 모델을 직접 배포할 수 있어요 Kimi K3 가중치 공개, 2.8조 파라미터 모델을 직접 배포할 수 있어요Kimi K3 Hugging Face 공개 썸네일Moonshot AI가 Kimi K3의 전체 가중치와 실행 코드를 Hugging Face에 공개했어요. 2.8조 개 파라미터, 104만 8,576 토큰 컨텍스트, 이미지와 영상을 다루는 멀티모달 기능을 한 모델에 담았어요. 이제 발표 자료를 보는 단계를 넘어 라이선스와 배포 조건을 직접 확인할 수 있어요. 1핵심 요약구분핵심왜 볼 만한가요공개 범위모델 가중치와 실행 코드가 Hugging Face에 올라왔어요연구팀과 기업이 자체 환경에서 모델을 시험하고 수정할 수 있어요모델 구조전체 2.8조 개 중 토큰마다 1,040억 개 파라미터를 활성화해요전체 규모와 한 번의 추론에 쓰는 계산량을..
2.8조 파라미터 Kimi K3 공개, 장시간 코딩을 겨냥한 개방형 모델 2.8조 파라미터 Kimi K3 공개, 장시간 코딩을 겨냥한 개방형 모델Kimi K3 개방형 AI 모델 썸네일Moonshot AI가 2.8조 파라미터 규모의 Kimi K3를 공개했어요. 네이티브 비전과 100만 토큰 컨텍스트를 지원하고, 긴 코딩 작업과 지식 업무를 이어 가는 데 초점을 맞춘 모델이에요. 전체 가중치는 2026년 7월 27일까지 공개할 예정이에요. 1핵심 요약구분핵심왜 볼 만한가요모델 규모전체 2.8조 파라미터와 100만 토큰 컨텍스트를 갖췄어요공개 예정 모델이 프론티어급 규모까지 커진 사례예요희소 구조896개 전문가 가운데 16개만 활성화하는 Stable LatentMoE를 써요전체 크기와 실제 추론 비용을 나눠 볼 필요가 있어요멀티모달 작업코드와 실행 화면을 함께 확인하며 게임, 프런..

728x90