본문 바로가기

IT & AI

Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요

728x90

Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요

Qwen 3.8 27B AI 모델 썸네일
Qwen 3.8 27B AI 모델 썸네일

Qwen이 270억 파라미터 규모의 멀티모달 모델 Qwen3.8-27B와 FP8 가중치를 공개했어요. 이미지와 영상을 읽고, 코딩이나 긴 작업을 여러 단계로 이어가는 용도를 한 모델에서 다뤄요. 개발자는 Hugging Face에서 가중치를 내려받아 자체 환경에 배치할 수 있어요. 2

핵심 요약

구분내용
모델270억 파라미터의 밀집형 비전·언어 모델이에요.
배포판블록 크기 128을 적용한 FP8 가중치를 Apache 2.0 라이선스로 제공해요.
문맥기본 262,144 토큰이며 YaRN 설정으로 최대 100만 토큰까지 늘릴 수 있어요.
추론 제어사고 모드를 끄거나 `reasoning_effort`를 `xhigh`, `medium`, `low`로 조절할 수 있어요.
실행 환경Transformers, vLLM, SGLang, TokenSpeed와 OpenAI 호환 Chat Completions API를 지원해요.

1. 27B 모델에 비전과 장기 작업 기능을 함께 넣었어요

Qwen3.8-27B는 텍스트 전용 모델이 아니에요. 비전 인코더를 결합해 문서와 과학 도표, 이미지, 영상까지 처리해요. 모델 카드에는 시간 단위 영상도 다룰 수 있다고 적혀 있어요. 텍스트와 시각 자료가 섞인 업무를 별도의 비전 모델 없이 구성하려는 팀이 살펴볼 만한 부분이에요. 2

공개된 FP8 배포판은 세밀한 블록 양자화를 적용했어요. Qwen은 원본 모델과 성능 지표가 거의 같다고 밝혔어요. Hugging Face 메타데이터에는 약 246억 개의 FP8 파라미터와 약 30억 개의 BF16 파라미터가 표시돼요. 전체 가중치 저장 용량은 약 30.9GB예요. 이 수치는 저장 용량이며 실제 실행에 필요한 GPU 메모리와 같지는 않아요. 런타임, KV 캐시, 입력 길이, 비전 입력에 따라 필요한 메모리가 더 늘어요.

728x90

사고 깊이와 대화 문맥을 요청별로 조절해요

사고 모드는 기본으로 켜져 있어요. 빠른 답이 필요하면 요청마다 끌 수 있어요. `reasoning_effort`를 낮추면 한 번의 응답은 빨라질 수 있지만, 분석이 부족해 재시도가 늘면 전체 시간과 토큰 사용량이 커질 수 있다고 모델 카드가 설명해요. 2

`preserve_thinking`은 이전 대화의 추론 내용을 다음 턴에도 보존하는 옵션이에요. 긴 코딩 작업이나 여러 도구를 순서대로 쓰는 작업에서 같은 판단을 되풀이하는 비용을 줄이려는 설계예요. 반대로 대화 기록이 길어지면 문맥과 KV 캐시가 커지므로, 서비스 운영자는 작업 특성에 맞춰 보존 범위를 정해야 해요.

26만 토큰이 기본이고 100만 토큰은 별도 설정이 필요해요

기본 문맥 길이는 262,144 토큰이에요. vLLM, SGLang, TokenSpeed에서 YaRN을 설정하면 최대 100만 토큰까지 늘릴 수 있어요. 다만 공개 프레임워크의 정적 YaRN은 입력 길이가 짧아도 같은 배율을 적용해요. Qwen도 짧은 텍스트의 성능이 달라질 수 있다며, 긴 문맥이 필요할 때만 설정을 바꾸라고 안내해요.

100만 토큰이라는 숫자만 보고 운영 비용을 판단하기는 어려워요. 실제 처리량은 KV 캐시 정밀도, 동시 요청 수, 영상 프레임 수, 출력 길이에 크게 좌우돼요. 긴 문서를 자주 다룬다면 최대 길이보다 목표 하드웨어에서의 지연 시간과 메모리 사용량을 먼저 재는 편이 안전해요.

벤치마크 점수는 평가 조건과 함께 읽어야 해요

Qwen이 공개한 결과에서 Terminal Bench 2.1은 73.0, SWE-bench Pro는 61.7을 기록했어요. 이전 27B 모델보다 각각 9.6점, 8.2점 높아요. 멀티모달 작업에서는 OSWorld-Verified 84.3, AndroidWorld 81.9를 제시했어요. 1

모든 숫자를 같은 조건의 외부 평가로 보기는 어려워요. QwenSWEBench와 CoWorkBench, RecreationBench는 Qwen이 만든 자체 평가예요. 일부 비교 모델은 공식 점수가 아니라 별도 실행 조건으로 다시 측정했어요. 시각 수학 평가에서는 모델별로 다른 지시문을 썼고, 일부 정답 표기도 수동으로 고친 뒤 계산했어요. 점수는 후보 모델을 좁히는 자료로 쓰고, 실제 업무 자료로 다시 비교해야 해요.

왜 중요한가요

Qwen3.8-27B-FP8은 직접 배치할 수 있는 27B급 모델에서 텍스트, 이미지, 영상, 코딩 작업을 한 API로 묶을 선택지를 늘려요. 가중치는 Apache 2.0 라이선스로 공개됐고 OpenAI 호환 API를 지원해요. 기존 애플리케이션의 클라이언트 코드를 크게 바꾸지 않고 자체 추론 서버를 시험하기 쉬워요. 2

도입 판단에서는 최고 점수보다 운영 조건이 더 직접적이에요. 짧은 요청이 많은 서비스라면 사고 모드와 YaRN을 기본값 그대로 쓰는 것이 비효율적일 수 있어요. 영상 처리나 긴 코딩 작업이 많다면 충분한 출력 길이와 KV 캐시 예산이 필요해요. 모델 카드의 수치를 출발점으로 삼되, 같은 데이터와 같은 도구 구성으로 지연 시간, 실패율, 메모리 사용량을 함께 재야 해요.

참고 자료

  1. Qwen 3.8 27B — GeekNews
  2. Qwen3.8-27B-FP8 모델 카드 — Qwen, Hugging Face
  3. Qwen3.8-27B 기본 모델 — Qwen, Hugging Face
  4. Apache License 2.0 — Apache Software Foundation
728x90