본문 바로가기

IT & AI

2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요

728x90

2.4조 파라미터 Qwen3.8 공개, 자체 호스팅의 문턱은 얼마나 높을까요

AI 뉴스 썸네일
AI 뉴스 썸네일

Qwen이 2.4조 파라미터 규모의 Qwen3.8-2.4T-A95B 가중치를 공개했어요. 기업이 Qwen의 Max급 모델을 자체 인프라에서 운영할 길이 열렸지만, 막대한 GPU 자원과 별도 상업 조건까지 함께 따져야 해요. 1

핵심 요약

구분핵심왜 볼만한가요
모델 규모전체 2.4조 파라미터 가운데 토큰마다 950억 파라미터를 써요거대한 모델의 성능을 MoE 구조로 나눠 쓰지만, 운영 규모는 여전히 데이터센터급이에요
작업 방식계획, 도구 사용, 결과 확인, 재시도를 잇는 장기 작업에 초점을 맞췄어요단발성 답변보다 코딩과 연구 업무를 끝까지 처리하는 능력을 겨냥했어요
실행 환경Transformers, vLLM, SGLang, TokenSpeed를 지원해요OpenAI 호환 API로 제공할 수 있어 기존 서비스와 연결하기 쉬워요
이용 조건자체 라이선스인 Qwen3.8-Max License를 적용해요사용 범위가 넓어도 일부 대형 상업 서비스에는 표시 또는 별도 허가 조건이 있어요

1. Qwen의 Max급 모델을 직접 운영할 수 있게 됐어요

Qwen3.8-2.4T-A95B는 Qwen3.8-Max의 기반이 되는 사후 학습 가중치와 설정 파일을 공개한 모델이에요. Qwen이 Max급 모델 가중치를 공개한 것은 이번이 처음이에요. 모델 카드에는 코딩, 전문 업무, 연구, 긴 시간에 걸친 도구 사용을 주요 용도로 적었어요. 2

전체 파라미터는 2.4조 개예요. 모든 파라미터를 계산할 때마다 쓰지는 않아요. 토큰 하나를 처리할 때 512개 전문가 가운데 라우팅 전문가 10개와 공유 전문가 1개를 골라 약 950억 파라미터를 활성화해요. 이런 MoE 구조는 계산량을 줄여 주지만, 2.4조 개 가중치를 메모리에 올리고 여러 GPU에 나눠 서빙해야 한다는 점은 그대로예요.

728x90

모델은 92개 레이어로 구성돼요. 기본 컨텍스트 길이는 262,144 토큰이고 설정을 바꾸면 최대 1,010,000 토큰까지 늘릴 수 있어요. 긴 코드 저장소나 여러 문서를 한 번에 다룰 여지는 커졌어요. 컨텍스트를 끝까지 늘리면 메모리 사용량과 응답 지연도 함께 커지므로 실제 환경에서는 처리량을 먼저 측정해야 해요.

Qwen은 이 모델이 어려운 질문에 답하는 것보다 복잡한 업무를 여러 단계에 걸쳐 마치는 데 초점을 맞췄다고 설명해요. `reasoning_effort`로 추론량을 조절할 수 있고, `preserve_thinking`으로 이전 대화의 추론 맥락을 다음 작업에 이어 쓸 수 있어요. 도구를 호출한 뒤 결과가 부족하면 계획을 고쳐 다시 시도하는 코딩·연구 작업에 맞춘 구성이에요.

공식 비교표에서 Qwen3.8-Max는 PaperBench 93.0, Terminal Bench 2.1 86.6, CoWorkBench 74.8을 기록했어요. 반면 SWE-bench Pro에서는 Fable 5가 80.0, Qwen3.8-Max가 67.7이었어요. DeepSWE 1.1에서도 GPT-5.6 Sol이 73.0, Qwen3.8-Max가 56.6이었어요. 특정 코딩 평가를 모두 앞선 모델이라기보다 연구와 도구 사용을 포함한 여러 업무에서 고른 성적을 낸 모델로 보는 편이 정확해요. 2

직접 운영할 때는 Hugging Face Transformers로 불러오거나 vLLM, SGLang, TokenSpeed 같은 서빙 엔진을 쓸 수 있어요. vLLM과 SGLang은 OpenAI 호환 API 형태로 모델을 제공할 수 있어요. 기존 애플리케이션이 OpenAI 형식의 요청을 사용한다면 연결 코드를 크게 바꾸지 않고 시험할 수 있어요.

공개 가중치와 Qwen Cloud의 Qwen3.8-Max 서비스는 기능이 같지 않아요. 공개 모델은 텍스트 입력과 사고 모드를 중심으로 제공돼요. 관리형 서비스는 이미지 입력, 비사고 모드, 기본 100만 토큰 컨텍스트, 내장 도구를 더 제공해요. 가중치를 받았다고 관리형 서비스를 그대로 재현할 수 있는 것은 아니에요.

라이선스도 확인해야 해요. 이 모델은 Apache 2.0 같은 범용 오픈소스 라이선스가 아니라 `Qwen3.8-Max License`를 사용해요. 복사, 수정, 배포, 호스팅, 미세 조정 권한을 폭넓게 허용하지만 조건이 붙어요. 월간 활성 사용자 1억 명 또는 월매출 2,000만 달러를 넘는 상업 서비스는 화면에 모델명을 표시해야 해요. 3

모델 서빙이나 코딩·업무 생산성 AI 사업을 운영하면서 계열사 합산 12개월 매출이 5,000만 달러를 넘으면 별도 상업 라이선스를 받아야 해요. 외부에 모델이나 출력, 기능을 제공하지 않는 내부 사용은 이 별도 허가 조건에서 빠져요. 그래서 이 모델은 오픈 웨이트라고 부를 수 있지만, 아무 조건 없는 오픈소스 모델로 소개하면 이용 범위를 잘못 전달할 수 있어요.

왜 중요한가요

대형 모델을 API로만 쓰던 기업에는 데이터 통제권과 운영 선택지가 늘었어요. 사내 코드와 문서를 외부 서비스로 보내기 어려운 조직은 자체 환경에서 모델을 시험할 수 있어요. 서빙 계층이 OpenAI 호환 형식을 지원하므로 기존 코딩 도구나 업무 시스템에 연결하는 실험도 수월해요. 2

다만 다운로드 가능 여부와 실제 운영 가능성은 다른 문제예요. 전체 가중치 규모가 2.4조 파라미터라서 개인용 GPU 몇 장으로 다루기 어려워요. 양자화, GPU 간 통신, 메모리 배치, 동시 요청 처리량을 함께 설계해야 해요. 자체 호스팅을 검토하는 팀이라면 모델 점수보다 필요한 GPU 수, 요청당 비용, 지연시간, 장애 복구 방식을 먼저 계산하는 편이 현실적이에요.

라이선스 조건은 제품 형태와 회사 매출에 따라 달라져요. 특히 외부 고객에게 모델 API나 코딩·사무 보조 기능을 제공하는 기업은 도입 전에 별도 허가 대상인지 확인해야 해요. 내부 연구나 사내 업무 적용과 외부 상업 서비스는 조건이 다르므로 법무 검토 없이 같은 기준을 적용하면 안 돼요. 3

참고 자료

  1. Qwen3.8-2.4T-A95B 오픈 웨이트 공개 — GeekNews
  2. Qwen3.8-2.4T-A95B 모델 카드 — Qwen, Hugging Face
  3. Qwen3.8-Max License — Qwen, Hugging Face
728x90