Qwen3.8-Max가 겨냥한 다음 단계, 며칠짜리 일을 끝내는 AI

Qwen이 2.4조 파라미터 규모의 Qwen3.8-Max를 공개했어요. 짧은 코드 생성보다 여러 날 이어지는 개발과 연구를 끝까지 수행하는 능력에 초점을 맞췄고, Max급 모델 가중치도 처음으로 공개할 예정이에요. 1
핵심 요약
| 구분 | 핵심 | 왜 볼 만한가요 |
| 모델 규모 | 전체 2.4조, 추론 때 활성화되는 파라미터는 950억 개예요 | 큰 모델을 필요한 부분만 쓰는 구조로 성능과 실행 비용의 균형을 노려요 |
| 장기 작업 | 개발, 논문 재현, 경진대회를 24시간에서 16일 동안 수행한 사례를 공개했어요 | 코딩 AI의 평가 기준이 함수 작성에서 프로젝트 완수로 옮겨가고 있어요 |
| 공개 계획 | Qwen Max 계열 가중치를 다음 주 공개할 예정이에요 | API뿐 아니라 직접 운영하고 조정할 수 있는 선택지가 생겨요 |
| 멀티모달 | 문서와 영상을 읽고 GUI 결과를 보면서 작업을 고쳐요 | 코드 실행과 화면 확인을 한 작업 흐름으로 묶으려는 시도예요 |
1. Qwen3.8-Max는 답변보다 긴 작업의 완주를 내세웠어요
Qwen3.8-Max는 Qwen3.5 구조를 확장해 전체 2.4조 파라미터와 활성 950억 파라미터를 사용해요. Qwen은 코딩, 일반 업무, 연구, 장기 작업에서 이전 세대보다 나아졌다고 설명했어요. 모델은 QwenCloud에서 먼저 쓸 수 있고, Qwen 계열 최초의 Max급 오픈 웨이트는 다음 주 Hugging Face와 ModelScope에 공개될 예정이에요. 2
이번 발표에서 눈에 띄는 숫자는 벤치마크 점수보다 작업 시간이에요. Qwen은 모델이 `oh-my-cli` 프로젝트를 약 16일간 운영하며 265개 커밋, 127개 PR, 151개 이슈를 만들었다고 밝혔어요. 논문 재현 작업은 약 125시간 이어졌고, 데이터 처리부터 33회의 GPU 학습까지 수행했어요. 또 멀티모달 경진대회에서는 24시간 동안 45회 제출해 정확도를 0.60에서 0.853으로 높였다고 해요. 2
이 사례들은 첫 계획을 고정하지 않았다는 공통점이 있어요. 모델이 코드 실행, 테스트, 실험 점수, 화면 결과를 확인하고 다음 시도를 바꿨어요. 암호화 하드웨어 설계 사례에서는 첫 결과의 8,298게이트를 500턴에 걸쳐 678게이트로 줄였고, 배치와 배선까지 마쳤다고 공개했어요. 개발자가 코드를 한 번 받아보는 방식보다 목표와 평가 기준을 주고 긴 작업을 맡기는 방식에 가까워요. 1
멀티모달 기능도 같은 방향을 따라요. 200페이지가 넘는 문서와 100시간이 넘는 영상을 처리하고, 만든 화면이나 3D 결과물을 직접 살펴 오류를 고치는 흐름을 지원해요. Qwen-MM-Plugins는 기존 코딩 도구에 이미지, 영상, 화면 조작 기능을 연결해요. Claude Code, Codex, Qwen Code 같은 도구와 호환되는 API도 제공해 기존 개발 환경에서 시험할 수 있어요. 2
다만 공개된 성능표를 그대로 모델 간 서열로 읽기는 어려워요. 일부 항목은 Qwen 내부 평가이고, 비교 모델마다 사용한 도구와 실행 조건이 달라요. 공식 자료에서도 Qwen3.8-Max가 모든 코딩 지표에서 가장 높지는 않아요. Terminal Bench 2.1은 86.6, SWE-bench Pro는 67.7을 기록했지만 다른 최신 모델이 앞선 항목도 있어요. 오픈 웨이트가 나온 뒤 같은 조건의 독립 평가를 확인해야 실제 격차를 판단할 수 있어요. 2
왜 중요한가요
개발팀이 봐야 할 변화는 모델 크기보다 작업 단위예요. 코딩 도구가 한 파일이나 한 PR을 넘어 며칠짜리 프로젝트를 맡으려면 상태 관리, 실패 복구, 테스트, 비용 제한이 함께 필요해요. Qwen3.8-Max의 공개 사례는 모델이 결과를 반복해서 확인하도록 실행 환경을 설계했을 때 어떤 작업까지 이어갈 수 있는지 보여줘요. 2
오픈 웨이트 계획도 실제 선택에 영향을 줘요. 가중치와 라이선스, 실행 요구사항이 공개되면 기업은 민감한 코드와 문서를 외부 API로 보내지 않고 운영할 수 있는지 검토할 수 있어요. 다만 전체 2.4조 파라미터 규모는 일반 개발 장비에서 다루기 어려워요. 다음 주 공개될 파일 구성과 양자화 지원, 라이선스, 필요한 GPU 자원을 확인한 뒤 도입 비용을 계산하는 편이 안전해요.
지금 확인할 항목은 세 가지예요. 먼저 오픈 웨이트가 발표 일정대로 나오는지 봐야 해요. 그다음 동일한 실행 조건에서 장기 작업 성공률과 비용을 비교해야 해요. 마지막으로 장시간 실행 중 잘못된 변경을 되돌리고 권한을 제한할 장치가 있는지 점검해야 해요. 높은 벤치마크 점수만으로는 며칠짜리 업무를 안심하고 맡기기 어려워요.
참고 자료
- Qwen3.8-Max: 코딩과 협업의 새로운 기준 — GeekNews
- Qwen3.8-Max: A New Bar for Coding and Cowork — Qwen
- GeekNews topic 32090 Markdown — GeekNews
'IT & AI' 카테고리의 다른 글
| 여러 AI 에이전트를 한 팀으로 운영하는 LobeHub (0) | 2026.08.04 |
|---|---|
| Kimi K3를 한 노드에 담은 AMD MI355X, 비용 효율은 B300을 앞섰어요 (0) | 2026.08.03 |
| AI 스타트업은 업무보다 시장 구조를 바꿀 수 있을까요 (1) | 2026.08.03 |
| AI-First 조직의 속도는 출시 뒤 학습에서 갈려요 (0) | 2026.08.03 |
| 미국 AI, 중국 오픈 모델에 기대는 역설 (1) | 2026.08.03 |