본문 바로가기

IT & AI

Grok 4.6, 성능보다 비용표가 더 눈에 띄어요

728x90

Grok 4.6, 성능보다 비용표가 더 눈에 띄어요

Grok 4.6 벤치마크 썸네일
Grok 4.6 벤치마크 썸네일

Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 받았어요. GPT-5.6 Sol과 같은 점수지만 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 책정됐어요. 여러 단계에 걸쳐 도구를 쓰는 작업에서도 상위권 결과를 냈고, 장시간 작업에서는 비교 모델보다 적은 턴과 입력 토큰을 썼어요. 1

핵심 요약

구분확인된 결과실제로 볼 부분
종합 점수AAII 61점으로 GPT-5.6 Sol과 같아요단일 점수보다 평가 항목별 편차를 함께 봐야 해요
세대 변화Grok 4.5보다 5점 올랐어요한 달여 만에 가격을 유지하며 점수를 높였어요
도구 사용GDPval-AA v2 Elo 1753, Terminal-Bench v2.1 88.4%를 기록했어요지식 작업과 터미널 작업에서 고른 결과가 나왔어요
API 가격입력 2달러, 출력 6달러예요같은 AAII 점수인 GPT-5.6 Sol보다 출력 단가가 5분의 1이에요
긴 작업AA-Briefcase Elo 1577, 평균 약 53턴을 기록했어요턴 수와 누적 입력 토큰이 실제 청구액에 영향을 줘요
주의점AA-Briefcase는 Artificial Analysis의 비공개 평가예요공개 벤치마크와 자체 업무 테스트를 함께 확인해야 해요

1. Grok 4.6은 같은 점수대 모델보다 출력 단가가 낮아요

Artificial Analysis가 공개한 Grok 4.6의 Intelligence Index 점수는 61점이에요. Claude Opus 5는 63점, Claude Fable 5는 62점이고 GPT-5.6 Sol은 Grok 4.6과 같은 61점이에요. Grok 4.5와 비교하면 5점 올랐고, Grok 4.3보다는 23점 높아요. 2

가격 차이는 점수 차이보다 커요. Grok 4.6의 기본 API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러예요. Claude Opus 5는 5달러와 25달러, GPT-5.6 Sol은 5달러와 30달러로 제시됐어요. Artificial Analysis가 측정한 작업당 비용은 0.84달러였어요. Kimi K3와 같은 비용이지만 Intelligence Index 점수는 Grok 4.6이 조금 높았어요.

728x90

이 수치는 출력이 긴 추론 작업에서 특히 눈에 들어와요. GPT-5.6 Sol과 AAII 점수는 같지만 Grok 4.6의 출력 토큰 단가는 5분의 1이에요. 캐시 적중 입력은 100만 토큰당 0.5달러예요. 이전 Grok 4.5의 0.3달러보다는 올랐으니 캐시 사용량이 큰 서비스라면 이 항목도 따로 계산해야 해요.

도구를 여러 번 쓰는 작업에서 결과가 좋았어요

Grok 4.6은 GDPval-AA v2에서 Elo 1753을 기록했어요. Claude Opus 5 다음이고 Claude Fable 5, Qwen3.8 Max와는 신뢰구간이 겹쳐요. 다중 턴 고객 서비스와 도구 사용을 평가하는 τ³-Banking 점수는 50.7%였어요. Qwen3.8 Max의 51.3%와 함께 상위 두 점수에 들어갔어요.

터미널 기반 소프트웨어 작업을 다루는 Terminal-Bench v2.1에서는 88.4%를 기록했어요. 지식 작업, 고객 서비스, 터미널 사용처럼 성격이 다른 평가에서 모두 경쟁력 있는 결과가 나온 셈이에요. Artificial Analysis는 이 결과와 작업당 비용을 함께 계산해 Grok 4.6을 비용 대비 성능 경계에 놓인 모델로 분류했어요. 3

긴 작업에서는 토큰 단가와 사용량을 같이 봐야 해요

Artificial Analysis의 장시간 지식 작업 평가인 AA-Briefcase에서 Grok 4.6은 Elo 1577을 받았어요. Claude Fable 5와 비슷한 구간이지만 Claude Opus 5 계열보다는 낮아요. 평균 작업량은 약 53턴과 5억 개의 입력 토큰이었어요. Claude Opus 5 최대 설정은 약 103턴과 20억 개의 입력 토큰을 썼어요.

여기서 5억 개는 한 번의 일반 사용자 요청량이 아니에요. 여러 장시간 평가 작업을 합친 평균 집계로 읽어야 해요. 그래도 긴 작업에서는 토큰당 가격만 비교하면 실제 비용을 놓칠 수 있다는 점은 분명해요. 모델이 답에 도달할 때까지 반복한 횟수와 누적 컨텍스트가 청구액을 바꿔요.

컨텍스트 윈도우는 Grok 4.5와 같은 50만 토큰이에요. 큰 문서나 긴 작업 기록을 한 번에 넣을 수 있지만, 컨텍스트 한도와 실제 작업 정확도는 별개예요. 긴 입력이 필요한 업무라면 정보 검색 정확도와 도구 호출 실패율도 자체 데이터로 확인하는 편이 안전해요.

왜 중요한가요

AI 모델을 고를 때 최고 점수 하나만 보면 예산을 잘못 잡기 쉬워요. 같은 61점인 모델도 출력 토큰 가격은 5배 차이가 나요. 여러 번 도구를 호출하는 업무에서는 턴 수와 누적 입력량까지 비용에 더해져요. Grok 4.6의 결과는 성능 점수, 토큰 단가, 작업당 사용량을 한 표에서 비교해야 하는 이유를 보여줘요. 2

다만 AAII는 여러 평가를 합친 지표이고 AA-Briefcase는 비공개 벤치마크예요. 61점이 모든 코딩, 고객 지원, 문서 분석 업무에서 같은 품질을 보장하지는 않아요. 도입 전에는 실제 프롬프트와 도구 구성으로 정답률, 실패 복구 횟수, 응답 시간, 요청당 비용을 함께 재는 편이 좋아요. 공개 평가에서 확인된 비용 우위가 자사 업무에서도 유지되는지는 그 테스트에서 결정돼요.

참고 자료

  1. Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입 — GeekNews
  2. SpaceXAI's Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index — Artificial Analysis
  3. Grok 4.6 Benchmarks — Artificial Analysis
728x90