본문 바로가기

728x90

GPU

(14)
Qwen3.8-27B 4비트 로컬 실행, 24GB Mac이 현실적인 기준이에요 Qwen3.8-27B 4비트 로컬 실행, 24GB Mac이 현실적인 기준이에요Qwen3.8-27B 로컬 실행 썸네일270억 파라미터 모델을 개인 장비에서 돌릴 때 가장 먼저 막히는 곳은 메모리예요. Unsloth가 공개한 Qwen3.8-27B 양자화 판은 4비트 기준으로 총 17~19GB 메모리를 요구해요. 24GB 통합 메모리를 갖춘 Mac이나 24GB급 GPU 데스크톱이라면 로컬 실행을 시험해 볼 수 있는 크기예요. 2핵심 요약구분공개된 내용실제로 확인할 점모델270억 파라미터 밀집형 모델이에요비전과 추론을 함께 지원해요4비트 메모리총 17~19GB가 필요해요24GB 장비가 실행 여유를 두기 좋아요실행 형식GGUF와 NVFP4를 제공해요GPU 세대와 실행 도구에 맞춰 골라야 해요문맥 길이기본 262,..
Unsloth Desktop, 로컬 AI 실행부터 학습까지 한 앱에 담았어요 Unsloth Desktop, 로컬 AI 실행부터 학습까지 한 앱에 담았어요AI 뉴스 썸네일로컬 AI 모델을 쓰려면 모델 실행기와 학습 도구, 서빙 환경을 따로 맞추는 일이 많았어요. Unsloth Desktop은 이 과정을 데스크톱 앱 하나로 묶은 베타 버전이에요. 모델을 내려받아 대화하는 데서 끝나지 않고 파인튜닝, 미디어 생성, 도구 연결까지 같은 화면에서 다뤄요. 1핵심 요약구분핵심왜 볼만한가요실행 환경macOS, Windows, Linux, WSL에서 로컬 AI 모델을 실행해요운영체제별로 여러 도구를 조합하던 부담을 줄일 수 있어요모델 학습LoRA, 전체 파인튜닝, 사전 학습을 앱에서 시작할 수 있어요데이터 준비부터 학습 결과 내보내기까지 한곳에서 이어져요개발 도구Claude Code, Code..
엔비디아가 AI 데이터센터의 잔존가치까지 보증하는 이유 엔비디아가 AI 데이터센터의 잔존가치까지 보증하는 이유AI 뉴스 썸네일엔비디아가 AI 데이터센터를 기관투자자가 살 수 있는 인프라 자산으로 바꾸려 해요. 목표는 5,000억 달러가 넘는 외부 자본을 끌어오는 것이지만, 투자 기회당 최대 25%의 잔존가치를 엔비디아가 보증하는 조건이 붙어요. 칩을 파는 회사가 데이터센터의 미래 가격까지 책임지는 구조라서 숫자보다 계약의 위험 배분을 먼저 봐야 해요. 1핵심 요약구분핵심왜 볼 만한가요자금 조달엔비디아는 자산운용사들과 AI 인프라 금융 플랫폼을 만들고 5,000억 달러 이상의 제3자 자본을 목표로 해요데이터센터 건설 비용을 빅테크의 현금과 회사채만으로 감당하기 어려워졌다는 뜻이에요위험 분담엔비디아가 투자 기회당 최대 25%의 잔존가치를 보증해요GPU 수요가 예..
AMD가 인수한 Taalas, AI 모델을 칩에 새겨 추론 속도를 높여요 AMD가 인수한 Taalas, AI 모델을 칩에 새겨 추론 속도를 높여요AI 뉴스 썸네일AMD가 AI 칩 스타트업 Taalas를 인수해 모델 전용 추론 가속기 기술을 확보해요. Taalas는 모델 가중치를 메모리에서 반복해서 읽는 대신 실리콘에 직접 넣어요. 빠른 토큰 생성이 강점이지만, 배포한 뒤 모델을 크게 바꾸려면 칩을 다시 만들어야 해요. 1핵심 요약구분핵심왜 볼 만한가요인수AMD가 토론토의 AI 칩 스타트업 Taalas를 인수해요GPU 중심이던 AMD의 AI 제품군에 모델 전용 추론 가속기가 더해질 수 있어요기술모델 가중치를 mask-ROM 영역에 새기고 KV 캐시와 미세조정 어댑터는 SRAM에 둬요가중치를 외부 메모리에서 옮기는 부담을 줄여 토큰 생성 속도를 높이려는 구조예요성능시험 칩 HC1..
AI 모델 고를 때, 지능만큼 응답 속도를 봐야 하는 이유 AI 모델 고를 때, 지능만큼 응답 속도를 봐야 하는 이유AI 뉴스 썸네일AI 모델의 성능이 일정 수준을 넘으면 기다리는 시간이 선택을 바꿔요. 코딩과 리서치처럼 사람이 중간 결과를 보며 방향을 잡는 작업에서는 답의 품질뿐 아니라 결과가 나오는 속도도 중요해졌어요. Martin Alderson은 일상 작업에 쓸 모델을 고를 때 순수한 지능보다 처리 속도를 더 많이 본다고 설명했어요. 2핵심 요약구분핵심왜 볼 만한가요체감 속도100~200tok/s는 빠르게 느껴지고, 50tok/s 아래는 기다림이 두드러져요사람이 결과를 읽고 다음 지시를 내리는 흐름이 달라져요모델 선택충분히 좋은 모델이 여러 개라면 응답 속도가 선택 조건이 돼요최고 성능 모델을 늘 고집할 이유가 줄어요제공자 경쟁같은 오픈 웨이트 모델도 제..
Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요 Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요AI 뉴스 썸네일2.8조 매개변수 규모의 Kimi K3를 AMD MI355X 8개로 구성한 한 노드에서 구동한 결과가 나왔어요. 엔비디아 B300이 절대 처리량에서는 빨랐지만, Wafer가 적용한 시간당 대여료로 계산하면 MI355X가 달러당 처리량에서 앞섰어요. 1핵심 요약구분핵심왜 볼 만한가요메모리 구성MI355X는 GPU당 288GB VRAM으로 Kimi K3와 100만 토큰 KV 캐시를 8개 GPU 한 노드에 담았어요초대형 모델은 연산 속도뿐 아니라 한 노드에 들어가는지가 비용과 통신량을 바꿔요처리량MI355X는 총 952 tok/s와 단일 스트림 118 tok/s를 기록했어요B200 두 노드 구성보다 노드당 처리..
70개 기술 노트를 한 페이지씩 읽는 Paged Out! 제9호 70개 기술 노트를 한 페이지씩 읽는 Paged Out! 제9호Paged Out 제9호 기술 잡지 썸네일긴 기술 글을 읽기 부담스러운 날에는 한 가지 아이디어만 선명하게 보여 주는 글이 더 잘 들어와요. 무료 기술 잡지 Paged Out! 제9호는 프로그래밍, 시스템, 보안, AI, 하드웨어를 다룬 글을 한 편당 한 페이지에 담았어요. 1이번 호에는 70편이 넘는 기사와 아트워크가 실렸어요. 주제가 넓지만, 실험을 재현하거나 구현 방식을 따라가 볼 수 있는 짧은 기술 노트가 중심이에요. 2핵심 요약구분담긴 내용읽어 볼 만한 이유AI·분산 시스템의미 기반 Kademlia, 에이전트 업무 구조, 로컬 RAG익숙한 구조를 AI 작업에 연결한 실험을 짧게 볼 수 있어요.로컬 AI·GPU6GB GPU 모델 교대 ..
DeepSeek 투자 중단설, 유출 녹취록이 드러낸 중국 AI의 계산 DeepSeek 투자 중단설, 유출 녹취록이 드러낸 중국 AI의 계산AI 뉴스 썸네일DeepSeek가 두 번째 투자 라운드의 계약 체결을 당분간 멈췄다는 보도가 나왔어요. 창업자 량원펑의 비공개 발언으로 알려진 녹취록이 퍼진 뒤 나온 결정이에요. 투자 중단 자체보다 녹취록에 담긴 연산 자원, 오픈소스, 지속 학습에 대한 판단이 중국 AI 산업의 현재 위치를 더 구체적으로 보여줘요. 1핵심 요약구분핵심왜 볼 만한가요투자 유치DeepSeek가 2차 투자 라운드의 계약 체결을 일시 중단했다고 전해졌어요협상 재개 가능성이 남아 있어 투자 철회로 단정하기는 일러요유출 논란첫 투자 당시 발언으로 알려진 녹취록이 온라인에 퍼졌어요보도는 녹취록의 진위를 독립적으로 확인하지 못했다고 밝혔어요연산 격차발언에는 중국 AI의..
AI 데이터센터 경쟁, GPU보다 전력과 건설이 먼저예요 AI 데이터센터 경쟁, GPU보다 전력과 건설이 먼저예요AI 데이터센터 인프라 썸네일AI 데이터센터를 늘리는 데 GPU 확보만큼 급한 문제가 생겼어요. 건물은 12~18개월 안에 지을 수 있지만 전력망 연결에는 5~7년이 걸려요. 전력과 인허가, 건설 인력, 냉각 설비를 제때 확보하는 능력이 실제 가동 시점을 좌우하고 있어요. 1핵심 요약구분핵심왜 볼 만한가요확장 병목데이터센터 건설보다 전력망 연결이 훨씬 오래 걸려요GPU를 주문해도 전력과 허가가 없으면 서비스를 가동할 수 없어요자체 전력사업자가 발전기와 배터리를 직접 갖추는 BYOP가 늘고 있어요전력망 접속 대기 시간을 줄이고 가동 일정을 통제하려는 선택이에요전력 장비변압기 납기가 최대 5년으로 늘고 랙 전력 밀도도 높아졌어요송전·전력 변환 장비가 데..
중국 오픈 가중치 AI가 배포 경쟁에서 유리한 이유 중국 오픈 가중치 AI가 배포 경쟁에서 유리한 이유AI 뉴스 썸네일중국 AI 기업들이 모델 가중치를 공개하며 배포 범위를 넓히고 있어요. 미국 기업이 중앙 서버의 유료 API로 최상위 성능을 파는 동안, 공개 가중치 모델은 기업이 원하는 인프라에 직접 올리고 공급자를 바꿀 선택지를 줘요. 다만 공개 전략이 장기적인 우위로 이어질지는 성능, 운영비, 라이선스와 정책까지 함께 봐야 해요.핵심 요약구분핵심왜 볼 만한가요배포 방식공개 가중치 모델은 여러 클라우드와 자체 서버에서 운영할 수 있어요모델 개발사가 모든 추론 인프라를 직접 확보하지 않아도 사용처가 늘어날 수 있어요기업 도입실제 전환 비용은 모델보다 계약, 데이터 연결, 권한 관리와 운영 도구에서 생겨요기업은 업무 시스템을 유지한 채 모델 공급자를 교체..

728x90