본문 바로가기

IT & AI

Qwen3.8 Max가 에이전트 평가에서 보여준 것

728x90

Qwen3.8 Max가 에이전트 평가에서 보여준 것

AI 뉴스 썸네일
AI 뉴스 썸네일

Qwen3.8 Max가 에이전트형 작업 평가에서 최상위권에 올랐어요. 단순 문답 점수보다 도구 사용과 계획, 여러 단계를 잇는 능력을 따로 측정했다는 점이 더 눈에 들어와요. 다만 순위표는 평가 추가와 모델 업데이트에 따라 바뀌므로, 1위라는 숫자만 떼어 보면 판단을 놓치기 쉬워요. 1

핵심 요약

구분핵심왜 볼 만한가요
에이전트 성능Qwen3.8 Max가 Agentic Index 최상위권에 올랐어요도구 사용과 계획을 포함한 실제 작업형 평가예요
일반 지능공식 모델 페이지의 Intelligence Index 점수는 58점이에요에이전트 순위와 일반 지능 순위는 같은 지표가 아니에요
운영 비용입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러예요성능뿐 아니라 반복 실행 비용까지 비교할 수 있어요
응답 특성출력 속도는 초당 약 68 토큰이고 평가 중 출력량은 많은 편이에요긴 에이전트 작업에서는 시간과 토큰 사용량이 운영비로 이어져요

1. 에이전트 평가 1위보다 봐야 할 숫자가 더 많아요

Artificial Analysis의 Agentic Index는 도구 사용, 계획, 자율성, 복합 문제 해결을 묶어 에이전트형 워크플로 성능을 비교해요. 현재 공개 페이지에는 139개 모델 가운데 선택된 24개가 차트에 표시돼요. 지표는 GDPval-AA v2와 𝜏³-Banking을 평균해 헤드라인 점수를 만들어요. GDPval-AA v2는 44개 직업과 9개 산업의 현실적인 과제를 다루고, 𝜏³-Banking은 큰 지식 기반을 탐색하며 여러 도구 호출을 이어 가는 금융 지원 업무를 시험해요. 2

GeekNews가 전한 시점에는 Qwen3.8 Max가 Agentic Index 종합 최고 모델로 소개됐어요. 이후 공식 순위표가 갱신되면서 현재 차트에는 Claude Opus 5가 먼저, Qwen3.8 Max가 그다음에 보여요. 이 차이는 보도가 틀렸다는 뜻보다 리더보드가 계속 움직인다는 사실에 가까워요. 새 모델과 평가 결과가 들어오면 순위가 달라질 수 있으니, 도입 검토 문서에는 조회 날짜와 지표 버전을 함께 남기는 편이 안전해요. 1 2

Qwen3.8 Max의 공식 모델 페이지를 보면 일반 지능 지표와 에이전트 지표를 구분해야 하는 이유가 선명해져요. Intelligence Index 점수는 58점이고, 같은 분류의 185개 모델 중 9위로 표시돼요. Agentic Index에서 강한 결과를 냈다고 해서 모든 지능 평가에서 곧바로 1위가 되는 구조는 아니에요. 코드 생성, 사실 신뢰성, 긴 문맥 추론, 업무 도구 사용처럼 필요한 역량에 맞는 세부 평가를 골라야 해요. 3

가격과 속도도 모델 성능의 일부예요

공식 페이지에 표시된 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러예요. 캐시 적중 입력은 100만 토큰당 0.25달러로 표시돼요. 출력 속도는 초당 약 67.6 토큰이에요. 100만 토큰의 콘텍스트 창을 지원하고 텍스트뿐 아니라 이미지와 영상 입력도 받을 수 있어요. 긴 문서와 여러 도구를 오가는 작업에는 유용할 수 있지만, 큰 콘텍스트 창을 매번 채우면 비용과 대기 시간이 함께 늘어요. 3

평가 과정의 출력량도 확인할 만해요. Qwen3.8 Max는 Intelligence Index 실행에서 약 1억 5천만 출력 토큰을 생성했고, 비교군 중앙값 7천만 토큰보다 많았어요. 모델이 답을 길게 생성하면 복합 과제에서 충분한 추론 흔적을 남길 수 있지만, API 운영에서는 비용과 지연으로 돌아와요. 같은 성공률이라면 작업당 비용, 작업당 시간, 출력 토큰 수를 함께 비교해야 실제 서비스 예산을 계산할 수 있어요. 3

팀에서 비교할 때는 같은 조건을 맞춰야 해요

에이전트 모델을 고를 때는 순위표 상단의 이름만 복사하지 않는 편이 좋아요. 먼저 팀이 자동화하려는 업무를 작은 평가 세트로 만들어요. 검색, 파일 수정, 데이터 조회, 승인 요청처럼 실제로 쓰는 도구를 연결하고 성공 조건을 고정해요. 그다음 같은 프롬프트, 같은 도구 권한, 같은 최대 실행 시간으로 후보 모델을 반복 시험하면 돼요.

728x90

결과표에는 성공률과 함께 평균 비용, 실패 후 재시도 횟수, 사람이 고친 시간도 적어 두는 게 좋아요. 벤치마크에서 높은 점수를 받은 모델도 사내 API 규격이나 한국어 문서 형식에서는 다른 결과를 낼 수 있어요. 반대로 종합 순위가 조금 낮아도 특정 업무에서 짧고 안정적으로 답하면 운영 모델로 더 잘 맞을 수 있어요.

왜 중요한가요

에이전트형 AI는 한 번 답하고 끝나는 챗봇과 비용 구조가 달라요. 검색하고, 도구를 호출하고, 결과를 읽고, 실패하면 다시 시도해요. 한 단계의 작은 차이가 긴 실행에서는 토큰과 대기 시간 차이로 벌어져요. Agentic Index가 점수뿐 아니라 작업당 비용, 실행 시간, 출력 토큰을 함께 보여 주는 이유예요. 2

Qwen3.8 Max의 결과는 모델 선택 기준이 일반 지능 점수 하나에서 업무별 성능으로 넓어지고 있다는 사례예요. 실제 도입에서는 최신 순위보다 재현 가능한 사내 평가가 더 오래 남아요. 공개 리더보드로 후보를 줄이고, 팀의 업무 데이터로 비용과 실패 유형을 다시 확인하면 과한 모델을 쓰거나 싼 모델을 잘못 고르는 일을 줄일 수 있어요.

참고 자료

  1. Qwen3.8 Max, Agentic Index 종합 1위 — GeekNews
  2. Best AI for Agentic Tasks: LLM Leaderboard — Artificial Analysis
  3. Qwen3.8 Max - Intelligence, Performance & Price Analysis — Artificial Analysis
728x90