본문 바로가기

728x90

RoCm

(3)
Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요 Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요AI 뉴스 썸네일2.8조 매개변수 규모의 Kimi K3를 AMD MI355X 8개로 구성한 한 노드에서 구동한 결과가 나왔어요. 엔비디아 B300이 절대 처리량에서는 빨랐지만, Wafer가 적용한 시간당 대여료로 계산하면 MI355X가 달러당 처리량에서 앞섰어요. 1핵심 요약구분핵심왜 볼 만한가요메모리 구성MI355X는 GPU당 288GB VRAM으로 Kimi K3와 100만 토큰 KV 캐시를 8개 GPU 한 노드에 담았어요초대형 모델은 연산 속도뿐 아니라 한 노드에 들어가는지가 비용과 통신량을 바꿔요처리량MI355X는 총 952 tok/s와 단일 스트림 118 tok/s를 기록했어요B200 두 노드 구성보다 노드당 처리..
AMD Ryzen AI Halo는 로컬 AI 개발 키트의 기준을 묻고 있어요 AMD Ryzen AI Halo는 로컬 AI 개발 키트의 기준을 묻고 있어요AI 뉴스 썸네일로컬에서 LLM을 돌리는 일은 이제 특별한 취미가 아니에요. 문제는 하드웨어를 고르고, 드라이버를 맞추고, 모델과 런타임을 연결하는 과정이 여전히 번거롭다는 점이에요. AMD Ryzen AI Halo는 성능만 내세우는 미니 PC라기보다, AMD 하드웨어로 AI 개발을 시작할 때 필요한 기준 환경을 묶어 파는 제품에 가까워요.핵심 요약구분핵심왜 볼만한가요로컬 AI 하드웨어Ryzen AI Max+ 395, 128GB 통합 메모리, 2TB SSD를 한 구성으로 묶었어요로컬 LLM 실험용 장비를 직접 조립하지 않아도 시작점을 잡을 수 있어요성능 비교llama-bench에서는 Apple Silicon Mac Studio가 ..
AI 추론 비용 싸움에 AMD MI355X가 끼어들었어요 AI 추론 비용 싸움에 AMD MI355X가 끼어들었어요AI 뉴스 썸네일AI 모델을 쓰는 비용은 모델 품질만큼이나 인프라 선택에 크게 좌우돼요. Wafer는 GLM-5.2를 AMD MI355X에서 돌리며, NVIDIA Blackwell보다 낮은 장비 비용으로 꽤 가까운 추론 처리량을 낼 수 있다고 주장했어요. 핵심은 GPU 가격보다 CUDA와 ROCm 사이의 소프트웨어 격차를 얼마나 줄일 수 있느냐예요.핵심 요약구분핵심왜 볼 만한가요AI 인프라Wafer는 AMD MI355X가 B300보다 GPU당 평균 약 2.75배 저렴하다고 설명해요추론 수요가 늘수록 모델 제공사의 원가 구조가 서비스 가격에 바로 영향을 줘요성능 테스트GLM-5.2 워크로드에서 2626 tok/s/node와 2.4 rps를 기록했어요B..

728x90