본문 바로가기

728x90

KimiK3

(14)
Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요 Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요AI 뉴스 썸네일2.8조 매개변수 규모의 Kimi K3를 AMD MI355X 8개로 구성한 한 노드에서 구동한 결과가 나왔어요. 엔비디아 B300이 절대 처리량에서는 빨랐지만, Wafer가 적용한 시간당 대여료로 계산하면 MI355X가 달러당 처리량에서 앞섰어요. 1핵심 요약구분핵심왜 볼 만한가요메모리 구성MI355X는 GPU당 288GB VRAM으로 Kimi K3와 100만 토큰 KV 캐시를 8개 GPU 한 노드에 담았어요초대형 모델은 연산 속도뿐 아니라 한 노드에 들어가는지가 비용과 통신량을 바꿔요처리량MI355X는 총 952 tok/s와 단일 스트림 118 tok/s를 기록했어요B200 두 노드 구성보다 노드당 처리..
Kimi K3 2.78조 모델을 64GB 맥북에서 돌린 WASTE Kimi K3 2.78조 모델을 64GB 맥북에서 돌린 WASTEKimi K3 로컬 추론 썸네일2.78조 파라미터 규모의 Kimi K3를 64GB MacBook Pro에서 실행한 오픈소스 프로젝트가 나왔어요. WASTE는 모델 전체를 메모리에 올리는 대신, 토큰 생성에 필요한 전문가 가중치만 NVMe에서 읽어요. 속도는 빠르지 않지만 초대형 MoE 모델을 개인용 하드웨어에서 구동하는 방법을 구체적인 수치로 보여줘요. 1핵심 요약구분내용실제 의미모델Kimi K3 2.78조 파라미터 전체 모델증류하거나 가지치기한 축소판이 아니에요저장공간변환된 컨테이너 982GiB내부 NVMe에 약 1TB 여유 공간이 필요해요메모리4K 컨텍스트 최소 29.05GiB, 권장 구성 64GB최소치로 열 수는 있어도 운영체제 페이징..
Kimi K3를 로컬에서 돌리려면 메모리가 얼마나 필요할까요 Kimi K3를 로컬에서 돌리려면 메모리가 얼마나 필요할까요Kimi K3 로컬 실행 썸네일Moonshot AI의 Kimi K3는 오픈 웨이트 모델이지만, 개인용 PC 한 대에 가볍게 올릴 수 있는 크기는 아니에요. Unsloth가 공개한 가장 작은 권장 양자화도 파일이 594GB이고, 실행에는 RAM과 VRAM을 합쳐 최소 610GB가 필요해요. 로컬 실행에서 말하는 ‘로컬’이 고성능 워크스테이션이나 여러 장의 GPU를 포함한다는 점부터 확인해야 해요. 1핵심 요약구분확인할 내용실제 의미모델 규모전체 2.8조, 추론 시 1,040억 매개변수 활성화MoE 구조여도 저장 공간과 메모리 요구량은 매우 커요가장 작은 권장 양자화`UD-IQ1_S` 594GB실행 환경에는 최소 610GB의 총 메모리가 필요해요품질..
Kimi K3 가중치 공개, 2.8조 파라미터 모델을 직접 배포할 수 있어요 Kimi K3 가중치 공개, 2.8조 파라미터 모델을 직접 배포할 수 있어요Kimi K3 Hugging Face 공개 썸네일Moonshot AI가 Kimi K3의 전체 가중치와 실행 코드를 Hugging Face에 공개했어요. 2.8조 개 파라미터, 104만 8,576 토큰 컨텍스트, 이미지와 영상을 다루는 멀티모달 기능을 한 모델에 담았어요. 이제 발표 자료를 보는 단계를 넘어 라이선스와 배포 조건을 직접 확인할 수 있어요. 1핵심 요약구분핵심왜 볼 만한가요공개 범위모델 가중치와 실행 코드가 Hugging Face에 올라왔어요연구팀과 기업이 자체 환경에서 모델을 시험하고 수정할 수 있어요모델 구조전체 2.8조 개 중 토큰마다 1,040억 개 파라미터를 활성화해요전체 규모와 한 번의 추론에 쓰는 계산량을..
오픈 웨이트 AI, 모델보다 생태계 경쟁이 중요해졌어요 오픈 웨이트 AI, 모델보다 생태계 경쟁이 중요해졌어요IT & AI 뉴스 썸네일오픈 웨이트 AI의 경쟁 기준이 모델 한 개의 성능에서 그 주변의 도구와 운영 체계로 넓어지고 있어요. Kubernetes가 공통 기반 위에 네트워킹, 스토리지, 관측성 도구를 키웠듯이 AI에서도 모델 서빙과 미세조정, 평가, 런타임이 하나의 생태계로 묶이는 흐름이에요. 다만 모델 가중치를 공개하는 것과 완전한 오픈 소스는 구분해서 봐야 해요. 1핵심 요약구분핵심왜 볼만한가요경쟁 단위모델 성능뿐 아니라 서빙, 평가, 관측성, 미세조정 도구가 함께 경쟁해요실제 도입 비용과 공급자 변경 가능성은 주변 도구에서 크게 갈려요오픈 웨이트학습된 가중치는 내려받아 수정할 수 있지만 학습 데이터와 전체 과정은 대개 공개되지 않아요오픈 소스 ..
오픈 웨이트 AI 규제에 빅테크 25곳이 제동을 건 이유 오픈 웨이트 AI 규제에 빅테크 25곳이 제동을 건 이유AI 뉴스 썸네일엔비디아와 마이크로소프트, 메타를 포함한 기술 기업 25곳이 오픈 웨이트 AI 모델을 성급하게 제한하지 말라고 정책 당국에 요청했어요. 중국 모델의 성능 향상과 기술 유출 의혹이 겹치면서, 미국의 AI 경쟁력과 보안 정책을 어디까지 묶어야 하는지가 쟁점으로 떠올랐어요. 1핵심 요약구분핵심왜 볼 만한가요공동 서한기술 기업 25곳이 오픈 웨이트 모델의 성급한 규제에 반대했어요모델 접근 정책이 기업의 선택권과 AI 경쟁 구도에 직접 영향을 줘요규제 쟁점중국 모델의 미국 내 접근 제한과 불법 증류 의혹이 함께 논의되고 있어요국가별 일괄 차단과 위법 행위별 제재는 결과가 크게 달라요개발 현장내려받아 수정하고 자체 인프라에서 실행할 수 있는 선..
중국 오픈 웨이트 AI 차단에 스타트업 200곳이 반대한 이유 중국 오픈 웨이트 AI 차단에 스타트업 200곳이 반대한 이유AI 뉴스 썸네일Proton과 Y Combinator를 포함한 실리콘밸리 기업 약 200곳이 중국 오픈 웨이트 AI 접근을 막지 말아 달라는 공동 서한을 미국 정부에 보냈어요. 이들은 중국 모델을 이용하는 미국 스타트업의 비용과 제품 선택권이 먼저 줄어들 수 있다고 주장했어요. 1미국 행정부가 전면 금지를 확정한 상황은 아니에요. POLITICO 보도를 정리한 GeekNews에 따르면 백악관 관계자들이 관련 사안을 논의했지만, 중국 오픈 웨이트 모델의 전면 금지는 당시 진지한 정책안으로 다뤄지지 않았어요. 2핵심 요약구분핵심왜 볼 만한가요공동 대응실리콘밸리 기업 약 200곳이 미국 정부에 서한을 보냈어요중국 모델 접근 제한이 실제 제품 비용과 ..
Kimi K3와 Fable 5, 작업별 라우팅이 더 나았어요 Kimi K3와 Fable 5, 작업별 라우팅이 더 나았어요Kimi K3와 Fable 5 모델 라우팅 비교Fireworks AI가 Kimi K3와 Fable 5를 약 1,030개 작업에서 비교했어요. 두 모델의 전체 성능은 비슷했지만 잘 푸는 문제가 달랐고, 작업마다 적합한 모델을 고른 이론적 조합은 정확도 93%를 기록했어요. 1핵심 요약구분핵심왜 볼만한가요비교 규모소프트웨어 수정, 터미널, 알고리듬, 다중 언어, 법률 등 약 1,030개 작업을 비교했어요단일 코딩 점수가 아니라 여러 실제 작업 유형을 함께 봤어요성능대표 소프트웨어 작업에서 K3는 92.4%, Fable은 92.6%였어요평균은 비슷해도 세부 영역의 우위는 달랐어요라우팅정답을 낸 모델 중 더 저렴한 선택지를 고르는 오라클 방식이 정확도 ..
오픈 웨이트 AI가 흔드는 모델 기업의 수익 공식 오픈 웨이트 AI가 흔드는 모델 기업의 수익 공식AI 뉴스 썸네일Kimi K3와 Qwen 3.8처럼 성능이 높아진 오픈 웨이트 모델이 잇달아 나오고 있어요. 이제 모델 기업은 벤치마크 순위뿐 아니라 추론 원가, 인프라 소유 범위, 제품의 전환 비용까지 함께 증명해야 해요. 1핵심 요약구분핵심실무에서 볼 점모델 경쟁오픈 웨이트 모델이 최상위 폐쇄형 모델과의 격차를 좁히고 있어요모델 이름보다 실제 업무의 성공률과 비용을 비교해야 해요비용 구조추론량이 늘면 GPU와 전력 비용도 함께 커져요토큰 가격 대신 완료된 과제 1건의 총비용을 재야 해요인프라데이터센터와 전력 조달 방식이 장기 마진에 영향을 줘요자체 구축과 외부 임대의 비용·운영 위험을 나눠 봐야 해요제품 방어력모델 교체가 쉬워질수록 실행 환경과 업무 데..
중국 AI 모델의 진짜 가격은 토큰 단가만으로 알 수 없어요 중국 AI 모델의 진짜 가격은 토큰 단가만으로 알 수 없어요AI 뉴스 썸네일중국 오픈 웨이트 모델이 빠르게 좋아지면서 가격 경쟁도 거세졌어요. 하지만 API 가격표의 토큰 단가만 비교하면 실제 서비스 비용을 잘못 판단할 수 있어요. 같은 답을 얻기까지 모델마다 쓰는 토큰과 컴퓨팅 자원이 다르기 때문이에요. 1핵심 요약구분핵심실무에서 볼 점비용 구조오픈 웨이트는 연구개발비를 줄여도 추론 비용까지 없애지는 못해요다운로드 가격과 운영 비용을 따로 계산해야 해요모델 비교토큰 100만 개 가격보다 과제 하나를 끝내는 총비용이 중요해요정답률, 재시도, 총 토큰, 지연 시간을 함께 재야 해요경쟁 구도중국 모델은 낮은 가격과 공개 가중치로 선택지를 넓혀요미국 모델과 같은 조건에서 과제당 비용을 비교해야 해요제품 전략모..

728x90