cerebras (4) 썸네일형 리스트형 Cerebras CS-4 공개, 랙 하나로 AI 추론 속도를 어디까지 높였나 Cerebras CS-4 공개, 랙 하나로 AI 추론 속도를 어디까지 높였나Cerebras CS-4 AI 추론 시스템 썸네일AI 추론 경쟁이 칩 한 장의 성능을 넘어 랙 전체 설계로 번지고 있어요. Cerebras가 공개한 CS-4는 웨이퍼 크기 가속기 3개와 전력, 냉각, I/O를 한 시스템으로 묶어 속도와 설치 시간을 함께 줄이려는 제품이에요. 2핵심 요약구분핵심왜 볼 만한가요추론 성능프로덕션 GPU 시스템보다 최대 30배 빠른 토큰 생성을 내세워요실시간 응답이 필요한 대형 모델 서비스의 지연 시간을 줄이는 데 초점을 맞췄어요전력 효율CS-3보다 와트당 처리량을 최대 10배 높였다고 밝혔어요데이터센터는 속도뿐 아니라 전력과 냉각 비용도 함께 계산해야 해요초대형 모델10조 개가 넘는 매개변수 모델에서 .. GPT-5.6 Sol Ultrafast, 초당 750 토큰이 바꾸는 대기 시간 GPT-5.6 Sol Ultrafast, 초당 750 토큰이 바꾸는 대기 시간GPT-5.6 Sol Ultrafast 썸네일GPT-5.6 Sol이 Cerebras 인프라에서 초당 최대 750개 출력 토큰을 내는 Ultrafast Mode로 제공돼요. OpenAI API의 새 서비스 계층으로 일부 고객에게 먼저 열렸어요. 빠른 출력이 실제 작업 시간까지 얼마나 줄이는지는 모델 밖의 도구와 시스템 속도에 따라 달라져요. 1핵심 요약구분확인된 내용실제로 볼 부분제공 방식OpenAI API에서 제한 공개됐어요용량이 늘면 접근 대상도 넓어질 예정이에요출력 속도초당 최대 750개 출력 토큰을 제시했어요최대치와 실제 요청의 지속 속도는 구분해서 봐야 해요HLE 평가2,500문항을 11시간 11분에 처리했어요Cerebr.. AMD가 인수한 Taalas, AI 모델을 칩에 새겨 추론 속도를 높여요 AMD가 인수한 Taalas, AI 모델을 칩에 새겨 추론 속도를 높여요AI 뉴스 썸네일AMD가 AI 칩 스타트업 Taalas를 인수해 모델 전용 추론 가속기 기술을 확보해요. Taalas는 모델 가중치를 메모리에서 반복해서 읽는 대신 실리콘에 직접 넣어요. 빠른 토큰 생성이 강점이지만, 배포한 뒤 모델을 크게 바꾸려면 칩을 다시 만들어야 해요. 1핵심 요약구분핵심왜 볼 만한가요인수AMD가 토론토의 AI 칩 스타트업 Taalas를 인수해요GPU 중심이던 AMD의 AI 제품군에 모델 전용 추론 가속기가 더해질 수 있어요기술모델 가중치를 mask-ROM 영역에 새기고 KV 캐시와 미세조정 어댑터는 SRAM에 둬요가중치를 외부 메모리에서 옮기는 부담을 줄여 토큰 생성 속도를 높이려는 구조예요성능시험 칩 HC1.. Cerebras가 사내 지식 검색을 하루 1만 5천 건까지 키운 설계 Cerebras가 사내 지식 검색을 하루 1만 5천 건까지 키운 설계AI 뉴스 썸네일사내 검색은 자료를 한곳에 모으는 일로 끝나지 않아요. 대화와 코드, 문서는 성격이 달라서 같은 검색 방식만 적용하면 필요한 답을 놓치기 쉬워요. Cerebras는 기존 업무 도구를 유지한 채 검색 계층을 연결했고, 출시 3개월 만에 하루 15,000건이 넘는 질문을 처리하고 있어요. 1핵심 요약구분핵심왜 볼 만한가요데이터 구조여러 출처를 공통 Postgres 임베딩 스키마에 연결했어요새 자료원을 붙여도 질의 계층을 다시 만들 필요가 적어요검색 품질전문 검색, 임베딩, IDF, 시간 감쇠를 함께 썼어요오류 코드와 자연어 질문을 한 방식으로 억지로 처리하지 않아요검색 범위채널과 저장소를 프로젝트 단위로 묶었어요조직 전체의 .. 이전 1 다음