본문 바로가기

IT & AI

Qwen3.8-Max가 겨냥한 다음 단계, 며칠짜리 일을 끝내는 AI

728x90

Qwen3.8-Max가 겨냥한 다음 단계, 며칠짜리 일을 끝내는 AI

AI 뉴스 썸네일
AI 뉴스 썸네일

Qwen이 2.4조 파라미터 규모의 Qwen3.8-Max를 공개했어요. 짧은 코드 생성보다 여러 날 이어지는 개발과 연구를 끝까지 수행하는 능력에 초점을 맞췄고, Max급 모델 가중치도 처음으로 공개할 예정이에요. 1

핵심 요약

구분핵심왜 볼 만한가요
모델 규모전체 2.4조, 추론 때 활성화되는 파라미터는 950억 개예요큰 모델을 필요한 부분만 쓰는 구조로 성능과 실행 비용의 균형을 노려요
장기 작업개발, 논문 재현, 경진대회를 24시간에서 16일 동안 수행한 사례를 공개했어요코딩 AI의 평가 기준이 함수 작성에서 프로젝트 완수로 옮겨가고 있어요
공개 계획Qwen Max 계열 가중치를 다음 주 공개할 예정이에요API뿐 아니라 직접 운영하고 조정할 수 있는 선택지가 생겨요
멀티모달문서와 영상을 읽고 GUI 결과를 보면서 작업을 고쳐요코드 실행과 화면 확인을 한 작업 흐름으로 묶으려는 시도예요

1. Qwen3.8-Max는 답변보다 긴 작업의 완주를 내세웠어요

Qwen3.8-Max는 Qwen3.5 구조를 확장해 전체 2.4조 파라미터와 활성 950억 파라미터를 사용해요. Qwen은 코딩, 일반 업무, 연구, 장기 작업에서 이전 세대보다 나아졌다고 설명했어요. 모델은 QwenCloud에서 먼저 쓸 수 있고, Qwen 계열 최초의 Max급 오픈 웨이트는 다음 주 Hugging Face와 ModelScope에 공개될 예정이에요. 2

이번 발표에서 눈에 띄는 숫자는 벤치마크 점수보다 작업 시간이에요. Qwen은 모델이 `oh-my-cli` 프로젝트를 약 16일간 운영하며 265개 커밋, 127개 PR, 151개 이슈를 만들었다고 밝혔어요. 논문 재현 작업은 약 125시간 이어졌고, 데이터 처리부터 33회의 GPU 학습까지 수행했어요. 또 멀티모달 경진대회에서는 24시간 동안 45회 제출해 정확도를 0.60에서 0.853으로 높였다고 해요. 2

이 사례들은 첫 계획을 고정하지 않았다는 공통점이 있어요. 모델이 코드 실행, 테스트, 실험 점수, 화면 결과를 확인하고 다음 시도를 바꿨어요. 암호화 하드웨어 설계 사례에서는 첫 결과의 8,298게이트를 500턴에 걸쳐 678게이트로 줄였고, 배치와 배선까지 마쳤다고 공개했어요. 개발자가 코드를 한 번 받아보는 방식보다 목표와 평가 기준을 주고 긴 작업을 맡기는 방식에 가까워요. 1

멀티모달 기능도 같은 방향을 따라요. 200페이지가 넘는 문서와 100시간이 넘는 영상을 처리하고, 만든 화면이나 3D 결과물을 직접 살펴 오류를 고치는 흐름을 지원해요. Qwen-MM-Plugins는 기존 코딩 도구에 이미지, 영상, 화면 조작 기능을 연결해요. Claude Code, Codex, Qwen Code 같은 도구와 호환되는 API도 제공해 기존 개발 환경에서 시험할 수 있어요. 2

다만 공개된 성능표를 그대로 모델 간 서열로 읽기는 어려워요. 일부 항목은 Qwen 내부 평가이고, 비교 모델마다 사용한 도구와 실행 조건이 달라요. 공식 자료에서도 Qwen3.8-Max가 모든 코딩 지표에서 가장 높지는 않아요. Terminal Bench 2.1은 86.6, SWE-bench Pro는 67.7을 기록했지만 다른 최신 모델이 앞선 항목도 있어요. 오픈 웨이트가 나온 뒤 같은 조건의 독립 평가를 확인해야 실제 격차를 판단할 수 있어요. 2

왜 중요한가요

개발팀이 봐야 할 변화는 모델 크기보다 작업 단위예요. 코딩 도구가 한 파일이나 한 PR을 넘어 며칠짜리 프로젝트를 맡으려면 상태 관리, 실패 복구, 테스트, 비용 제한이 함께 필요해요. Qwen3.8-Max의 공개 사례는 모델이 결과를 반복해서 확인하도록 실행 환경을 설계했을 때 어떤 작업까지 이어갈 수 있는지 보여줘요. 2

오픈 웨이트 계획도 실제 선택에 영향을 줘요. 가중치와 라이선스, 실행 요구사항이 공개되면 기업은 민감한 코드와 문서를 외부 API로 보내지 않고 운영할 수 있는지 검토할 수 있어요. 다만 전체 2.4조 파라미터 규모는 일반 개발 장비에서 다루기 어려워요. 다음 주 공개될 파일 구성과 양자화 지원, 라이선스, 필요한 GPU 자원을 확인한 뒤 도입 비용을 계산하는 편이 안전해요.

728x90

지금 확인할 항목은 세 가지예요. 먼저 오픈 웨이트가 발표 일정대로 나오는지 봐야 해요. 그다음 동일한 실행 조건에서 장기 작업 성공률과 비용을 비교해야 해요. 마지막으로 장시간 실행 중 잘못된 변경을 되돌리고 권한을 제한할 장치가 있는지 점검해야 해요. 높은 벤치마크 점수만으로는 며칠짜리 업무를 안심하고 맡기기 어려워요.

참고 자료

  1. Qwen3.8-Max: 코딩과 협업의 새로운 기준 — GeekNews
  2. Qwen3.8-Max: A New Bar for Coding and Cowork — Qwen
  3. GeekNews topic 32090 Markdown — GeekNews
728x90