본문 바로가기

IT & AI

Cerebras CS-4 공개, 랙 하나로 AI 추론 속도를 어디까지 높였나

728x90

Cerebras CS-4 공개, 랙 하나로 AI 추론 속도를 어디까지 높였나

Cerebras CS-4 AI 추론 시스템 썸네일
Cerebras CS-4 AI 추론 시스템 썸네일

AI 추론 경쟁이 칩 한 장의 성능을 넘어 랙 전체 설계로 번지고 있어요. Cerebras가 공개한 CS-4는 웨이퍼 크기 가속기 3개와 전력, 냉각, I/O를 한 시스템으로 묶어 속도와 설치 시간을 함께 줄이려는 제품이에요. 2

핵심 요약

구분핵심왜 볼 만한가요
추론 성능프로덕션 GPU 시스템보다 최대 30배 빠른 토큰 생성을 내세워요실시간 응답이 필요한 대형 모델 서비스의 지연 시간을 줄이는 데 초점을 맞췄어요
전력 효율CS-3보다 와트당 처리량을 최대 10배 높였다고 밝혔어요데이터센터는 속도뿐 아니라 전력과 냉각 비용도 함께 계산해야 해요
초대형 모델10조 개가 넘는 매개변수 모델에서 초당 1,000개 이상의 토큰을 제시했어요여러 웨이퍼를 연결할 때 생기는 통신 지연을 줄인 결과라는 설명이에요
배포 방식컴퓨팅, 전력, I/O를 모듈로 나누고 부품 수를 50% 줄였어요시설을 먼저 준비한 뒤 컴퓨팅 모듈을 장착할 수 있어 설치와 정비가 단순해져요

1. CS-4는 칩보다 랙 전체를 다시 설계했어요

CS-4 한 대에는 WSE-3 Turbo 3개가 들어가요. Cerebras는 각 웨이퍼가 이전 세대보다 최대 2배 빠르며, 완성된 시스템은 프로덕션 GPU 시스템보다 토큰을 최대 30배 빠르게 생성한다고 설명해요. 이 수치는 Cerebras가 공개한 자사 비교값이라 실제 도입 환경에서는 모델 종류, 배치 크기, 문맥 길이와 비용 조건을 함께 확인해야 해요. 2

성능을 끌어올린 방법은 동작 속도만 높이는 데 그치지 않아요. 전력 공급 장치를 프로세서에서 0.5mm 떨어진 곳에 배치해 보드에서 잃는 전력을 줄였어요. 일반 GPU 보드에서 언급한 약 50mm 거리와 비교하면 전력 공급 경로가 약 100분의 1로 짧아요. Cerebras는 이 설계로 WSE-3 Turbo에 이전보다 2배 많은 전력을 공급할 수 있다고 밝혔어요. 3

웨이퍼 사이의 통신도 손봤어요. 새 I/O 하위 시스템은 대역폭을 2배로 높이고, 웨이퍼 간 지연을 최저 2마이크로초까지 낮춰요. 회사가 제시한 기준으로는 매개변수 10조 개가 넘는 모델에서도 초당 1,000개 이상의 토큰을 생성해요. 다만 어떤 모델과 정밀도, 동시 사용자 조건으로 측정했는지는 공개 자료에서 더 세밀하게 확인할 필요가 있어요. 1

서버를 부품이 아닌 모듈로 교체해요

CS-4는 Nexus Platform Architecture의 첫 제품이에요. 웨이퍼, 전력 변환, 직접 액체 냉각, 고속 I/O와 제어 장치를 Wafer-Scale Backpack이라는 조립체에 담았어요. Cerebras는 이 구조로 기존 설계보다 부품 수를 50% 줄였고, 설치에 걸리는 시간을 수일에서 수 시간으로 낮췄다고 설명해요. 2

전력, 냉각, 네트워크 계층과 컴퓨팅 모듈을 따로 설치할 수 있다는 점도 눈에 띄어요. 데이터센터 운영자는 PowerRack을 먼저 넣어 시설을 점검한 뒤 웨이퍼 모듈을 연결할 수 있어요. 고장이 난 부분이나 다음 세대 컴퓨팅 모듈을 교체할 때 랙 전체를 다시 구성하는 부담도 줄일 수 있어요.

728x90

최대 성능보다 실제 비용을 함께 봐야 해요

CS-4가 겨냥하는 곳은 빠른 응답이 중요한 대규모 추론 환경이에요. 긴 추론 과정이나 많은 도구 호출을 처리하는 서비스라면 사용자 한 명이 기다리는 시간을 줄일 여지가 있어요. 반면 공개 자료의 최대 30배 수치는 특정 비교 조건에서 나온 제조사 주장이고, 장비 가격과 전력 사용량, 지원 모델, 가동률은 포함하지 않아요.

첫 출하는 2026년 3분기에 시작될 예정이에요. 실제 경쟁력은 고객 환경에서 측정한 지연 시간과 시간당 처리량, 토큰당 비용이 공개된 뒤 더 분명해질 거예요. 현재 단계에서는 웨이퍼 크기 가속기와 모듈형 랙 설계를 하나의 배포 단위로 묶었다는 점을 먼저 볼 만해요. 2

왜 중요한가요

대형 AI 모델의 응답 속도는 연산 성능만으로 정해지지 않아요. 가속기 사이에서 데이터를 옮기는 시간, 전력을 공급하는 거리, 냉각 방식과 설치 절차가 모두 실제 처리량에 영향을 줘요. CS-4는 이 병목을 랙 수준에서 함께 다루고 있어요. 3

AI 서비스를 운영하는 팀이라면 최고 초당 토큰 수 하나만 비교하면 부족해요. 목표 모델을 지원하는지, 긴 문맥과 동시 요청에서 속도가 유지되는지, 장애가 났을 때 모듈을 얼마나 빨리 교체할 수 있는지까지 봐야 해요. CS-4가 내세운 모듈형 구조는 이런 운영 조건을 성능 경쟁의 일부로 끌어들였어요.

참고 자료

  1. Cerebras CS-4, 랙 규모 AI 추론 시스템 — GeekNews
  2. Cerebras CS-4 — Cerebras
  3. Cerebras CS-4 데이터시트 — Cerebras
728x90