AMD (6) 썸네일형 리스트형 AMD가 인수한 Taalas, AI 모델을 칩에 새겨 추론 속도를 높여요 AMD가 인수한 Taalas, AI 모델을 칩에 새겨 추론 속도를 높여요AI 뉴스 썸네일AMD가 AI 칩 스타트업 Taalas를 인수해 모델 전용 추론 가속기 기술을 확보해요. Taalas는 모델 가중치를 메모리에서 반복해서 읽는 대신 실리콘에 직접 넣어요. 빠른 토큰 생성이 강점이지만, 배포한 뒤 모델을 크게 바꾸려면 칩을 다시 만들어야 해요. 1핵심 요약구분핵심왜 볼 만한가요인수AMD가 토론토의 AI 칩 스타트업 Taalas를 인수해요GPU 중심이던 AMD의 AI 제품군에 모델 전용 추론 가속기가 더해질 수 있어요기술모델 가중치를 mask-ROM 영역에 새기고 KV 캐시와 미세조정 어댑터는 SRAM에 둬요가중치를 외부 메모리에서 옮기는 부담을 줄여 토큰 생성 속도를 높이려는 구조예요성능시험 칩 HC1.. Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요 Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요AI 뉴스 썸네일2.8조 매개변수 규모의 Kimi K3를 AMD MI355X 8개로 구성한 한 노드에서 구동한 결과가 나왔어요. 엔비디아 B300이 절대 처리량에서는 빨랐지만, Wafer가 적용한 시간당 대여료로 계산하면 MI355X가 달러당 처리량에서 앞섰어요. 1핵심 요약구분핵심왜 볼 만한가요메모리 구성MI355X는 GPU당 288GB VRAM으로 Kimi K3와 100만 토큰 KV 캐시를 8개 GPU 한 노드에 담았어요초대형 모델은 연산 속도뿐 아니라 한 노드에 들어가는지가 비용과 통신량을 바꿔요처리량MI355X는 총 952 tok/s와 단일 스트림 118 tok/s를 기록했어요B200 두 노드 구성보다 노드당 처리.. SIMD는 평범한 반복문을 어떻게 5배 빠르게 만들었을까요 SIMD는 평범한 반복문을 어떻게 5배 빠르게 만들었을까요SIMD 반복문 성능 최적화 썸네일배열이나 문자열을 한 값씩 검사하는 반복문은 코드 곳곳에 있어요. SIMD는 이런 연속 데이터를 4개, 8개, 16개씩 묶어 같은 연산을 수행해요. Ghostty 개발자 Mitchell Hashimoto는 코드 포인트 검색 루프에 이 방식을 적용했고, AVX2 기반 인텔 데스크톱에서 터미널 전체 처리량이 약 5배 높아졌다고 밝혔어요. 1핵심 요약구분핵심왜 볼 만한가요처리 방식여러 값을 벡터 하나에 담아 동시에 계산해요연속 데이터를 다루는 반복문의 명령 수를 줄일 수 있어요공통 구조준비, 적재, 연산, 축소·저장, 나머지 처리의 5단계를 따라요CPU 전용 어셈블리를 몰라도 적용 흐름을 파악할 수 있어요실제 결과Gho.. GLM 5.2가 AI 추론 가격을 흔들 수 있을까요 GLM 5.2가 AI 추론 가격을 흔들 수 있을까요AI 뉴스 썸네일AI 모델 경쟁이 학습비에서 추론비로 옮겨가고 있어요. GLM 5.2는 오픈 가중치 모델이 프런티어 모델의 에이전트 작업 영역까지 들어올 때 가격표가 어떻게 흔들릴 수 있는지 보여주는 사례예요.핵심 요약구분핵심왜 볼 만한가요모델 경쟁GLM 5.2는 Opus·GPT 계열 모델에 가까운 코딩 에이전트 경험을 낮은 API 가격으로 내세워요모델 품질 격차가 줄면 기업과 개발자는 비싼 기본 모델만 고집할 이유가 줄어요비용 구조논점은 학습비보다 사용량에 따라 계속 늘어나는 추론비예요API 매출총이익이 높을수록 싼 대체 모델이 들어올 공간도 커져요약점비전 미지원, 느린 체감 속도, 웹 검색 품질은 아직 걸림돌이에요에이전트 작업은 텍스트 답변만 잘해서 .. AMD Ryzen AI Halo는 로컬 AI 개발 키트의 기준을 묻고 있어요 AMD Ryzen AI Halo는 로컬 AI 개발 키트의 기준을 묻고 있어요AI 뉴스 썸네일로컬에서 LLM을 돌리는 일은 이제 특별한 취미가 아니에요. 문제는 하드웨어를 고르고, 드라이버를 맞추고, 모델과 런타임을 연결하는 과정이 여전히 번거롭다는 점이에요. AMD Ryzen AI Halo는 성능만 내세우는 미니 PC라기보다, AMD 하드웨어로 AI 개발을 시작할 때 필요한 기준 환경을 묶어 파는 제품에 가까워요.핵심 요약구분핵심왜 볼만한가요로컬 AI 하드웨어Ryzen AI Max+ 395, 128GB 통합 메모리, 2TB SSD를 한 구성으로 묶었어요로컬 LLM 실험용 장비를 직접 조립하지 않아도 시작점을 잡을 수 있어요성능 비교llama-bench에서는 Apple Silicon Mac Studio가 .. AI 추론 비용 싸움에 AMD MI355X가 끼어들었어요 AI 추론 비용 싸움에 AMD MI355X가 끼어들었어요AI 뉴스 썸네일AI 모델을 쓰는 비용은 모델 품질만큼이나 인프라 선택에 크게 좌우돼요. Wafer는 GLM-5.2를 AMD MI355X에서 돌리며, NVIDIA Blackwell보다 낮은 장비 비용으로 꽤 가까운 추론 처리량을 낼 수 있다고 주장했어요. 핵심은 GPU 가격보다 CUDA와 ROCm 사이의 소프트웨어 격차를 얼마나 줄일 수 있느냐예요.핵심 요약구분핵심왜 볼 만한가요AI 인프라Wafer는 AMD MI355X가 B300보다 GPU당 평균 약 2.75배 저렴하다고 설명해요추론 수요가 늘수록 모델 제공사의 원가 구조가 서비스 가격에 바로 영향을 줘요성능 테스트GLM-5.2 워크로드에서 2626 tok/s/node와 2.4 rps를 기록했어요B.. 이전 1 다음