본문 바로가기

728x90

GPU

(14)
Kimi K3가 신규 구독을 멈춘 이유 Kimi K3가 신규 구독을 멈춘 이유AI 뉴스 썸네일Moonshot AI가 Kimi K3의 신규 유료 구독을 잠시 멈췄어요. 출시 뒤 수요가 예상보다 빠르게 늘면서 최근 48시간의 GPU 사용량이 현재 용량 한계에 가까워졌기 때문이에요. 기존 가입자는 계속 이용할 수 있어요.핵심 요약구분핵심왜 볼 만한가요신규 가입Moonshot AI가 Kimi K3 신규 구독을 일시 중단했어요대기열보다 기존 유료 사용자의 이용 품질을 먼저 지키는 결정을 내렸어요인프라최근 48시간의 수요가 현재 GPU 용량 한계에 근접했어요AI 서비스의 성장 속도와 실제 추론 자원 확보 속도가 맞지 않을 수 있어요재개 방식용량을 늘린 뒤 신규 가입 자리를 배치 단위로 다시 열 계획이에요한꺼번에 가입을 받지 않고 실제 처리 여력을 보며 ..
AI 답변 한 줄이 데이터센터를 통과하는 15단계 AI 답변 한 줄이 데이터센터를 통과하는 15단계AI 뉴스 썸네일AI 서비스에 질문을 보내면 화면에는 글자가 한 토큰씩 나타나요. 그 짧은 시간에 요청은 인증과 라우팅을 거쳐 GPU에 배치되고, GPU 메모리와 서버 간 연결망을 통과해요. 답변 속도와 비용은 모델 크기만으로 정해지지 않아요. 캐시 적중률, 메모리 대역폭, 배치 방식, 네트워크 혼잡까지 함께 작용해요. 1핵심 요약구분실제로 일어나는 일서비스 운영에서 볼 지점요청 진입토큰화, 인증, 과금 등급 확인, 부하 분산을 거쳐요요청 제한과 캐시 친화적 라우팅이 초기 비용을 바꿔요프리필입력 토큰을 병렬로 읽고 KV 캐시를 만들어요입력 길이와 연산량이 첫 토큰 대기시간에 영향을 줘요디코드이전 결과를 참고해 다음 토큰을 하나씩 만들어요HBM 대역폭과 출력..
Mac mini가 AI 에이전트용 컴퓨터로 다시 주목받는 이유 Mac mini가 AI 에이전트용 컴퓨터로 다시 주목받는 이유AI 뉴스 썸네일AI 에이전트를 오래 실행하려는 개발자들이 Mac mini와 Mac Studio를 별도 장비로 찾고 있어요. 주로 쓰는 컴퓨터와 작업을 분리하면서도 로컬에서 직접 통제할 수 있다는 점이 수요를 만들고 있어요.핵심 요약구분핵심왜 볼 만한가요전용 장비Mac mini와 Mac Studio가 상시 실행용 AI 장비로 거론됐어요작은 데스크톱의 역할이 개인 서버에 가까워지고 있어요칩 설계LLM 연산뿐 아니라 도구 호출과 주변 작업까지 칩 전체가 맡아요GPU 성능만으로 실제 에이전트 경험을 설명하기 어려워요실행 방식기기와 클라우드가 작업을 나누는 구성이 예상돼요비용, 보안, 응답 속도를 함께 조절할 수 있어요1. Mac mini는 AI 에이..
AI 추론 비용 싸움에 AMD MI355X가 끼어들었어요 AI 추론 비용 싸움에 AMD MI355X가 끼어들었어요AI 뉴스 썸네일AI 모델을 쓰는 비용은 모델 품질만큼이나 인프라 선택에 크게 좌우돼요. Wafer는 GLM-5.2를 AMD MI355X에서 돌리며, NVIDIA Blackwell보다 낮은 장비 비용으로 꽤 가까운 추론 처리량을 낼 수 있다고 주장했어요. 핵심은 GPU 가격보다 CUDA와 ROCm 사이의 소프트웨어 격차를 얼마나 줄일 수 있느냐예요.핵심 요약구분핵심왜 볼 만한가요AI 인프라Wafer는 AMD MI355X가 B300보다 GPU당 평균 약 2.75배 저렴하다고 설명해요추론 수요가 늘수록 모델 제공사의 원가 구조가 서비스 가격에 바로 영향을 줘요성능 테스트GLM-5.2 워크로드에서 2626 tok/s/node와 2.4 rps를 기록했어요B..

728x90