Qwen3.8 27B 지능 지수 52점, 점수보다 토큰 사용량을 함께 봐야 해요

Qwen3.8 27B가 Artificial Analysis Intelligence Index에서 52점을 받았어요. 같은 규모의 오픈 가중치 모델 중앙값 9보다 높지만, 평가에 쓴 출력 토큰도 1억 6,000만 개로 중앙값보다 약 3.7배 많았어요. 모델을 고를 때는 점수와 함께 응답 길이, 속도, 실제 운영 비용을 확인해야 해요. 1
핵심 요약
| 구분 | 내용 |
| 평가 결과 | Artificial Analysis Intelligence Index 52점을 기록했어요. 같은 규모의 오픈 가중치 모델 중앙값은 9점이에요. |
| 토큰 사용 | 전체 평가에서 출력 토큰 1억 6,000만 개를 생성했어요. 비교군 중앙값 4,300만 개보다 약 3.7배 많아요. |
| 공개 조건 | 270억 매개변수 가중치를 Apache 2.0으로 공개해 자체 호스팅과 상업적 이용이 가능해요. |
| 확인할 점 | 원문 표의 가격은 입력과 출력 모두 100만 토큰당 0달러지만, 속도와 작업당 비용은 공개되지 않았어요. |
1. 27B급 모델의 높은 점수에는 긴 추론이라는 비용이 붙어요
Artificial Analysis는 Qwen3.8 27B에 Intelligence Index 52점을 부여했어요. 이 지수는 코딩, 도구 사용, 과학적 추론, 긴 문맥 처리 등 9개 평가를 합산해요. Qwen3.8 27B는 4B 초과 40B 이하인 Small 등급에 들어가며, 같은 등급의 오픈 가중치 모델 중앙값 9점을 크게 넘었어요. 2
270억 매개변수로 52점을 얻은 결과는 모델 후보를 좁힐 때 유용해요. 평가 과정에서 생성한 토큰 수는 별도로 봐야 해요. Qwen3.8 27B는 Intelligence Index 전체 평가에서 출력 토큰 1억 6,000만 개를 썼어요. 같은 비교군 중앙값은 4,300만 개예요. 긴 추론과 답변이 점수에 얼마나 영향을 줬는지는 실제 작업으로 확인할 필요가 있어요. 2
Artificial Analysis 페이지는 장황성에 4점 만점 중 4점을 표시해요. 이 점수는 답변 품질이 낮다는 뜻은 아니에요. 같은 업무를 반복하면 생성 시간이 늘고 GPU 점유 시간도 길어질 수 있다는 신호에 가까워요. 자체 서버에서 여러 요청을 동시에 처리할 팀이라면 정확도 외에 요청당 출력 토큰과 완료 시간을 따로 재야 해요.
가격 표에는 입력과 출력 모두 100만 토큰당 0달러로 나와요. 하지만 속도와 Intelligence Index 작업당 비용은 N/A예요. 가중치를 직접 내려받는 모델이라 API 토큰 가격이 없어도 GPU 구매비, 전력, 메모리, 운영 인력 비용은 남아요. 따라서 0달러 표기를 무료 운영으로 읽으면 안 돼요. 2
공식 모델 카드는 Qwen3.8 27B를 이미지와 텍스트를 함께 처리하는 Dense 모델로 설명해요. 매개변수는 270억 개이고 기본 문맥 길이는 262,144토큰이에요. 최대 100만 토큰까지 확장할 수 있으며, 추론 모드는 요청마다 끌 수 있고 `reasoning_effort`로 깊이를 조절할 수 있어요. 가중치와 설정 파일은 Apache 2.0 라이선스로 공개됐어요. 3
도입 전에 직접 재야 할 항목
- 팀이 자주 쓰는 코딩, 문서 분석, 이미지 질의 작업을 각각 나눠 시험해요.
- 정답률과 함께 요청당 출력 토큰, 첫 토큰 대기 시간, 전체 완료 시간을 기록해요.
- 간단한 작업은 낮은 추론 강도나 추론 비활성화 설정도 비교해요.
- 긴 문맥을 쓸 때는 입력과 출력의 합이 실제 제공 환경의 한도를 넘지 않는지 확인해요.
- 동시 요청이 늘어날 때 필요한 GPU 메모리와 처리량을 계산해요.
왜 중요한가요
오픈 가중치 모델의 매개변수 수가 적어져도 운영비가 자동으로 줄지는 않아요. Qwen3.8 27B처럼 출력 토큰을 많이 쓰는 추론 모델은 한 요청을 오래 점유할 수 있어요. 벤치마크 점수가 높더라도 짧은 답이 필요한 고객 지원이나 반복 코딩 작업에서는 대기 시간이 더 중요한 지표가 될 수 있어요. 2
자체 호스팅을 검토하는 팀에는 선택지가 넓어졌어요. Apache 2.0 가중치, 이미지 입력, 262,144토큰 기본 문맥을 한 모델에서 쓸 수 있어요. 대신 업무별 추론 강도를 정하지 않으면 쉬운 요청에도 긴 답을 만들 수 있어요. 운영 전 비교에서는 최고 점수 한 개보다 작업 성공률, 완료 시간, 출력 토큰을 같은 표에 놓는 편이 정확해요. 3
Artificial Analysis의 52점은 모델 후보를 좁히는 데 쓸 수 있어요. 최종 선택은 실제 프롬프트와 서버 환경에서 내려야 해요. 특히 원문에 비어 있는 생성 속도와 작업당 비용은 직접 측정해야 판단할 수 있어요.
참고 자료
- Qwen3.8 27B, Artificial Analysis 지능 지수 52점 기록 — GeekNews
- Qwen3.8 27B - Intelligence, Performance & Price Analysis — Artificial Analysis
- Qwen3.8-27B Model Card — Qwen, Hugging Face
'IT & AI' 카테고리의 다른 글
| Claude Code 주간 한도 50% 상향, 8월 31일까지 더 이어져요 (0) | 2026.08.19 |
|---|---|
| Bluesky는 어떻게 스크린샷에만 로고를 띄울까요 (0) | 2026.08.18 |
| GPT-5.6 Sol 비전 성능, 탐지는 뛰었지만 OCR은 제자리였어요 (0) | 2026.08.18 |
| DuckDB v2.0 미리보기, 파일 안의 분석 DB가 서버로 넓어져요 (0) | 2026.08.18 |
| Stripe의 OpenRouter 인수 합의 보도, AI 모델 선택과 결제가 만나요 (0) | 2026.08.18 |