Qwen 3.8 27B, 성능보다 먼저 바꿔야 할 추론 설정

Qwen 3.8 27B는 노트북에서도 코드 작성과 이미지 분석을 맡길 수 있는 로컬 AI 모델이에요. 다만 기본 추론 강도인 `xhigh`를 그대로 쓰면 간단한 작업에도 시간과 토큰을 지나치게 쓸 수 있어요. 실제 사용에서는 작업 난이도에 맞춰 추론 강도를 낮추는 설정이 모델 성능만큼 중요해요. 1
핵심 요약
| 구분 | 내용 |
| 모델 | 270억 매개변수와 비전 기능을 갖춘 모델이며 Apache 2.0 라이선스로 공개됐어요. |
| 문맥 | 기본 모델은 262,144토큰 문맥을 지원하고 최대 100만 토큰까지 확장할 수 있어요. |
| 기본 설정 | 추론 강도 `xhigh`가 기본이라 단순한 요청도 오래 분석할 수 있어요. |
| 실사용 | `low`나 추론 비활성화로 시작한 뒤 복잡한 작업에서만 강도를 올리는 편이 효율적이에요. |
1. 좋은 로컬 모델도 기본 설정이 사용성을 바꿔요
Qwen 3.8 27B는 이미지와 텍스트를 함께 처리하는 270억 매개변수 모델이에요. 공식 모델 카드에는 코딩, 도구 호출, 장기 작업과 비전 이해를 지원한다고 적혀 있어요. 모델 가중치와 설정 파일도 Hugging Face에 공개됐고, 라이선스는 Apache 2.0이에요. 기본 문맥은 262,144토큰이며 최대 100만 토큰까지 확장할 수 있어요. 3
Simon Willison은 128GB M5 Max MacBook Pro와 NVIDIA DGX Spark에서 17GB Q4_K_M 양자화 버전을 시험했어요. 자전거를 타는 펠리컨 SVG를 만드는 작업에서는 결과물의 세부 묘사가 좋았어요. 하지만 기본 `xhigh` 설정이 추론에 22,276토큰과 21분을 썼어요. 추론을 끈 같은 작업은 3,715토큰을 출력하고 137초 만에 끝났어요. 결과 품질은 낮아졌지만 시간 차이는 컸어요. 2
작은 요청에서도 비슷한 성향이 나타났어요. 원 하나를 그려 달라는 작업에 동심원, 그라데이션, 애니메이션과 색상 구성까지 덧붙였어요. 보기 좋은 결과가 나왔지만 요청 범위를 벗어났고 완료 시간도 길어졌어요. 추론 강도가 높을수록 항상 더 적합한 결과를 주는 건 아니라는 사례예요.
비전 작업은 강점이 뚜렷했어요. 사진 속 펠리컨 두 마리의 경계 상자를 0~1000 좌표로 반환했고, 좌표가 실제 대상과 가깝게 맞았어요. 이어서 경계 상자를 이미지 위에 그리는 HTML 도구도 한 번의 요청으로 만들었어요. 추론을 끈 버전은 상자 위치를 잘못 계산했지만, 추론을 사용한 버전은 제대로 작동했어요. 복잡한 공간 계산에서는 어느 정도의 추론이 결과 차이로 이어진 셈이에요. 2
코딩 작업에서도 여러 파일을 읽고 기존 구조를 설명한 뒤 필요한 도구를 작성하고 실행했어요. 긴 문맥과 도구 호출을 함께 쓰는 로컬 코딩 작업에 활용할 수 있다는 실험 결과예요. 다만 LM Studio에서 측정된 생성 속도는 초당 15~30토큰 수준이었어요. `llama.cpp`의 다중 토큰 예측을 적용한 별도 비교에서는 초당 39.12토큰에서 67.20토큰으로 올라 약 72% 빨라졌어요. 실행 엔진과 설정에 따라 체감 속도가 크게 달라질 수 있어요. 2
처음 실행할 때 확인할 설정
- 짧은 코드 수정이나 단순 이미지 작업은 `low` 또는 추론 비활성화로 시작해요.
- 여러 파일의 관계를 찾거나 도구를 연속으로 호출할 때만 추론 강도를 높여요.
- LM Studio의 문맥 한도가 8,192토큰으로 잡혀 있으면 긴 추론 중 한도를 다 쓸 수 있어요.
- 속도가 부족하면 `llama.cpp`의 다중 토큰 예측 지원 여부를 확인해요.
- 공식 벤치마크 수치는 Qwen 자체 측정치이므로 독립 평가와 실제 작업 결과를 함께 봐야 해요.
왜 중요한가요
로컬 모델을 고를 때 매개변수 수와 벤치마크만 비교하면 실제 대기 시간을 놓치기 쉬워요. Qwen 3.8 27B 사례에서는 같은 모델과 같은 요청도 추론 설정에 따라 21분과 137초로 벌어졌어요. 로컬 환경은 호스팅 API보다 생성 속도가 느릴 수 있어서 과한 추론이 더 크게 느껴져요. 2
추론을 무조건 끄는 것도 답은 아니에요. 경계 상자 시각화 도구처럼 좌표 변환과 화면 구성을 함께 처리한 작업에서는 추론을 사용한 결과가 더 정확했어요. 짧은 작업은 낮은 강도로 빠르게 처리하고, 여러 단계의 판단이 필요한 작업만 강도를 올리면 속도와 정확도를 조절할 수 있어요.
Qwen 3.8 27B는 가중치를 내려받아 직접 운영할 수 있고 비전과 코딩 작업도 함께 맡길 수 있어요. 운영 전에 기본값을 그대로 쓰기보다 작업 유형별 추론 강도, 문맥 한도, 실행 엔진을 먼저 정해 두는 편이 좋아요. 팀에서 반복 실행하는 작업이라면 완료 시간과 토큰 사용량을 함께 기록해야 적절한 설정을 찾을 수 있어요. 3
참고 자료
- Qwen 3.8 27B는 뛰어나지만 기본 설정에서 지나치게 오래 추론함 — GeekNews
- Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things — Simon Willison's Weblog
- Qwen3.8-27B Model Card — Qwen, Hugging Face
'IT & AI' 카테고리의 다른 글
| DuckDB v2.0 미리보기, 파일 안의 분석 DB가 서버로 넓어져요 (0) | 2026.08.18 |
|---|---|
| Stripe의 OpenRouter 인수 합의 보도, AI 모델 선택과 결제가 만나요 (0) | 2026.08.18 |
| Claude 텍스트 워터마크, 단어 선택을 바꿔도 품질은 같을까요 (1) | 2026.08.18 |
| Codex에서 GPT-5.6 Sol 100만 토큰 컨텍스트를 켜는 방법 (0) | 2026.08.18 |
| Docbank, 사람과 AI 에이전트가 함께 쓰는 로컬 문서 금고 (0) | 2026.08.18 |