본문 바로가기

IT & AI

Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요

728x90

Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요

AI 뉴스 썸네일
AI 뉴스 썸네일

2.8조 매개변수 규모의 Kimi K3를 AMD MI355X 8개로 구성한 한 노드에서 구동한 결과가 나왔어요. 엔비디아 B300이 절대 처리량에서는 빨랐지만, Wafer가 적용한 시간당 대여료로 계산하면 MI355X가 달러당 처리량에서 앞섰어요. 1

핵심 요약

구분핵심왜 볼 만한가요
메모리 구성MI355X는 GPU당 288GB VRAM으로 Kimi K3와 100만 토큰 KV 캐시를 8개 GPU 한 노드에 담았어요초대형 모델은 연산 속도뿐 아니라 한 노드에 들어가는지가 비용과 통신량을 바꿔요
처리량MI355X는 총 952 tok/s와 단일 스트림 118 tok/s를 기록했어요B200 두 노드 구성보다 노드당 처리량과 단일 스트림 속도가 높았어요
비용 효율제시된 대여료 기준 MI355X는 48 tok/s/$, B300은 33 tok/s/$였어요절대 속도가 느려도 GPU 임대료와 배치 구조에 따라 서비스 비용이 달라질 수 있어요
최적화추측 디코딩과 어텐션 헤드 제로 패딩으로 디코드와 프리필 병목을 줄였어요새 커널 없이 PyTorch 함수와 형상 조정으로 ROCm 경로를 손봤어요

1. 큰 모델에서는 HBM 용량이 배치 구조를 바꿔요

Kimi K3는 가중치만 1.5TB가 넘고, 100만 토큰 문맥을 위한 KV 캐시도 필요해요. GPU당 192GB인 B200 8개 노드 하나에는 이 구성을 담기 어려워 B200 시험은 16개 GPU를 두 노드에 나눈 TP16으로 진행됐어요. 반면 MI355X와 B300은 GPU당 288GB를 제공해 8개 GPU 한 노드에서 모델을 실행했어요. 2

Wafer의 1,024토큰 입력·400토큰 출력 시험에서 MI355X는 총 952 tok/s와 단일 스트림 118 tok/s를 기록했어요. B300은 총 1,568 tok/s와 단일 스트림 172 tok/s로 두 항목 모두 더 빨랐어요. B200 TP16은 두 노드 전체에서 총 498 tok/s, 단일 스트림 90 tok/s였어요. B200 구성은 디코드 과정에서 약 195Gb/s RoCE v2를 거쳐 노드 간 all-reduce를 수행해 통신 비용도 부담했어요. 2

비용 계산에서는 순서가 달라졌어요. Wafer는 GPU 1개당 시간당 가격을 MI355X 2.50달러, B300 6달러, B200 4.25달러로 놓았어요. 이 가격을 최대 처리량에 적용하면 MI355X는 48 tok/s/$, B300은 33 tok/s/$, B200은 7 tok/s/$예요. MI355X가 B300보다 빠르다는 뜻은 아니에요. 해당 가격과 배치 조건에서 처리량 1단위를 사는 비용이 더 낮았다는 결과예요.

728x90

성능을 끌어올린 방법도 구체적이에요. 외부 초안 모델인 Kimi-K3-DSpark를 붙인 추측 디코딩은 MI355X의 단일 스트림 성능을 약 2.2배 높였고, 최대 총 처리량도 18% 늘렸어요. ROCm 빌드에서 빠져 있던 top-k 확률 재정규화 함수는 `sort`, `masked_fill`, 나눗셈을 조합한 PyTorch 코드로 보완했어요. 별도의 사용자 정의 커널을 만들지 않고 sglang의 샘플링 경로를 고친 사례예요. 2

프리필은 MI355X의 약점으로 남았어요. 17만 2천 토큰 콜드 프리필에 MI355X는 약 51초, B300은 약 23초가 걸렸어요. 연구팀은 TP8에서 rank당 12개가 되는 어텐션 헤드를 16개로 제로 패딩해 AITER MLA 커널이 받을 수 있는 형상으로 바꿨어요. 그 결과 프리필 처리량이 기존 Triton 경로의 약 4천~7천 tok/s에서 약 1만 3천 tok/s로 올랐어요. 이 조정은 전체 디코드 처리량보다 첫 토큰 대기 시간을 줄이는 데 영향을 줬어요. 2

다만 달러당 성능 수치는 보편적인 하드웨어 가격표로 보기 어려워요. Wafer가 선택한 클라우드 대여료를 사용했고, 전력비와 장비 구매비, 약정 할인, 실제 인스턴스 재고는 계산에 넣지 않았어요. 비교 대상도 MI355X와 B300은 단일 노드지만 B200은 두 노드예요. 운영 지역과 계약 조건이 바뀌면 비용 순위도 달라질 수 있어요. 공개된 글에는 설정 전체를 재현할 코드가 없어 다른 사업자의 같은 조건 시험도 더 필요해요. 3

왜 중요한가요

초대형 오픈 웨이트 모델을 운영할 때 GPU 선택 기준이 연산 성능만으로 끝나지 않는다는 사례예요. 모델 가중치와 KV 캐시가 한 노드에 들어가면 노드 간 통신을 줄일 수 있어요. GPU 수가 같아도 HBM 용량, 네트워크 구성, 시간당 요금에 따라 실제 서비스 비용이 크게 달라져요. 2

개발팀은 평균 처리량과 사용자 체감 속도를 따로 봐야 해요. 많은 요청을 동시에 처리하는 서비스라면 총 tok/s와 비용이 중요해요. 긴 문서를 넣고 첫 답을 기다리는 서비스라면 TTFT와 콜드 프리필 시간이 더 직접적인 지표예요. 이번 결과에서도 MI355X는 달러당 총 처리량이 좋았지만, 최적화 전 긴 프리필에서는 B300보다 오래 걸렸어요.

도입 전에 같은 입력·출력 길이와 동시성으로 후보 GPU를 시험하는 편이 좋아요. 온디맨드 가격만 비교하지 말고 확보 가능한 물량, 전력비, 네트워크, 소프트웨어 수정 비용까지 함께 계산해야 해요. 추측 디코딩이나 형상 보정을 적용했다면 정확도와 도구 호출 결과가 바뀌지 않았는지도 확인해야 해요.

참고 자료

  1. AMD MI355X에서 Kimi K3를 실행해 B300보다 높은 달러당 성능 달성 — GeekNews
  2. Is memory the moat? — Wafer
  3. GeekNews topic 32089 Markdown — GeekNews
728x90