AMD가 인수한 Taalas, AI 모델을 칩에 새겨 추론 속도를 높여요

AMD가 AI 칩 스타트업 Taalas를 인수해 모델 전용 추론 가속기 기술을 확보해요. Taalas는 모델 가중치를 메모리에서 반복해서 읽는 대신 실리콘에 직접 넣어요. 빠른 토큰 생성이 강점이지만, 배포한 뒤 모델을 크게 바꾸려면 칩을 다시 만들어야 해요. 1
핵심 요약
| 구분 | 핵심 | 왜 볼 만한가요 |
| 인수 | AMD가 토론토의 AI 칩 스타트업 Taalas를 인수해요 | GPU 중심이던 AMD의 AI 제품군에 모델 전용 추론 가속기가 더해질 수 있어요 |
| 기술 | 모델 가중치를 mask-ROM 영역에 새기고 KV 캐시와 미세조정 어댑터는 SRAM에 둬요 | 가중치를 외부 메모리에서 옮기는 부담을 줄여 토큰 생성 속도를 높이려는 구조예요 |
| 성능 | 시험 칩 HC1은 Llama 3.1 8B를 초당 16,960 토큰으로 처리했다고 밝혔어요 | 공개 수치가 실제 서비스 환경에서도 유지되는지 확인할 가치가 있어요 |
| 제약 | 큰 모델 변경에는 칩 재제작이 필요해요 | 속도와 비용을 얻는 대신 모델 교체 유연성을 포기하는 선택이에요 |
1. 범용 GPU와 다른 길을 고른 모델 전용 칩
AMD가 인수하는 Taalas는 2023년 캐나다 토론토에서 출발한 회사예요. 인수 금액은 공개되지 않았어요. 거래는 규제 승인을 거쳐 2026년 4분기에 마무리될 예정이에요. AMD는 이 기술을 Instinct 가속기와 Helios 랙 규모 시스템에 결합할 가능성을 열어 두고 있어요. 2
Taalas의 칩은 모델 전용 집적회로인 MSIC에 가까워요. mask-ROM 영역에는 모델 가중치를 넣고, SRAM 영역에는 KV 캐시와 미세조정 어댑터를 저장해요. GPU처럼 HBM에서 가중치를 계속 불러오는 구조와 달라요. 생성할 때마다 같은 가중치를 옮기는 비용을 줄여 단일 모델의 추론 처리량을 높이려는 방식이에요.
첫 시험 칩 HC1은 TSMC 6nm 공정으로 제작됐어요. Taalas가 공개한 결과에서 Meta Llama 3.1 8B를 초당 16,960 토큰으로 처리했어요. 발표 시점의 Nvidia GPU보다 48배, Cerebras 가속기보다 8.5배 빠르다는 비교도 함께 내놨어요. 이 수치는 회사가 선택한 모델과 시험 조건에서 나온 결과예요. 서로 다른 시스템의 가격, 전력, 지연 시간, 배치 크기를 같은 조건으로 맞춘 독립 검증 자료는 기사에 제시되지 않았어요.
2세대 HC2는 칩 하나에 200억 파라미터를 담는 것을 목표로 해요. 더 큰 모델은 여러 칩에 가중치를 나눠 파이프라인 병렬 방식으로 처리해요. 계산상 칩 50개를 연결하면 1조 파라미터 규모까지 지원할 수 있다는 설명이에요. 실제 제품의 출시 일정과 대규모 연결 효율은 이후 공개 자료를 확인해야 해요.
AMD가 구상하는 조합도 흥미로워요. Instinct GPU는 입력 구간의 연산을 맡고, Taalas 기반 가속기는 토큰 생성을 담당하는 식이에요. 두 작업의 병목이 다르다는 점을 이용해 한 랙 안에서 역할을 나눌 수 있어요. 다만 AMD가 구체적인 제품 구성이나 고객 도입 계획을 확정해 공개한 단계는 아니에요.
빠른 대신 모델을 쉽게 바꾸기 어려워요
가중치를 실리콘에 넣으면 칩을 배포한 뒤 모델 구조나 가중치를 크게 바꾸기 어려워요. LoRA 같은 작은 어댑터는 별도 SRAM에 둘 수 있지만, 그 범위를 넘는 변경에는 칩 재제작이 필요해요. Taalas는 새 모델로 바꿀 때 전체 설계를 다시 하는 대신 금속층 2개를 바꾸면 된다고 설명해요. 그래도 소프트웨어 파일을 교체하는 것보다 시간과 비용이 커요.
이 제약은 모델 교체가 잦은 연구 환경보다 오래 유지할 모델이 정해진 서비스에서 덜 부담스러워요. 반복 업무를 대량 처리하는 추론 서비스나 속도와 단가를 우선하는 제품이 후보가 될 수 있어요. 반대로 최신 모델을 수시로 바꾸는 팀은 칩이 만들어지는 동안 모델이 뒤처질 위험까지 계산해야 해요.
왜 중요한가요
AI 서비스 비용은 GPU 가격만으로 정해지지 않아요. 모델 가중치를 옮기는 메모리 대역폭, 토큰 생성 속도, 전력, 랙 공간이 함께 영향을 줘요. Taalas는 범용성을 줄이고 자주 쓰는 모델의 데이터 이동을 줄이는 쪽을 택했어요. 대량 추론에서 충분한 수요를 확보하면 같은 모델을 더 빠르고 저렴하게 제공할 여지가 있어요. 2
성패는 공개된 최고 속도보다 전체 운영비에서 갈릴 수 있어요. 칩 제작비, 모델 교체 주기, 전력 사용량, 여러 칩을 연결했을 때의 효율을 함께 봐야 해요. HC1의 초당 16,960 토큰은 기술 가능성을 보여 주지만, 다양한 모델과 실제 요청 패턴에서도 같은 이점이 나오는지는 아직 확인되지 않았어요.
AMD에는 제품 조합을 넓힐 기회예요. Instinct GPU로 변화가 잦은 모델을 먼저 운영하고, 수요가 안정된 모델을 전용 칩으로 옮기는 방식이 가능해질 수 있어요. 이 구성이 제품으로 나오면 AI 인프라 구매자는 범용 GPU만 비교하지 않고 모델 수명과 호출량에 맞춰 하드웨어를 고르게 돼요.
참고 자료
'IT & AI' 카테고리의 다른 글
| Paseo, 코딩 에이전트 작업을 폰에서도 이어서 관리해요 (0) | 2026.08.08 |
|---|---|
| Orca, 병렬 코딩 에이전트를 worktree로 나눠 관리해요 (0) | 2026.08.08 |
| LLM의 과학적 도약, 데이터 압축만으로 설명하기 어려운 이유 (0) | 2026.08.07 |
| Qwen3.8 Max가 에이전트 평가에서 보여준 것 (0) | 2026.08.07 |
| 메타 Muse Code 공개, 24시간 코딩 작업을 버티는 구조는 무엇이 다른가요 (0) | 2026.08.07 |