본문 바로가기

IT & AI

Grok 4.6, 모델 크기보다 사후 학습으로 코딩 성능을 높였어요

728x90

Grok 4.6, 모델 크기보다 사후 학습으로 코딩 성능을 높였어요

AI 뉴스 썸네일
AI 뉴스 썸네일

xAI가 장시간 코딩 작업과 지식 노동에 초점을 맞춘 Grok 4.6을 공개했어요. 새 기반 모델을 크게 키우기보다 추가 학습, 지도 미세조정(SFT), 강화학습(RL)을 다듬어 성능을 끌어올린 점이 눈에 띄어요. 1

핵심 요약

구분핵심왜 볼 만한가요
학습Grok 4.5보다 긴 추가 학습과 새 SFT 궤적을 적용했어요파라미터 수 확대 외에도 학습 데이터와 후처리 방식이 모델 품질을 바꿀 수 있다는 사례예요
코딩CursorBench 3.2에서 69.9%, FrontierCode 1.1 Extended에서 61.3%를 기록했어요여러 단계가 이어지는 코딩 작업과 초기 제품 구현에 초점을 맞췄어요
한계DeepSWE 1.1은 65.9%, Terminal-Bench 3.0은 26%였어요모든 코딩 평가에서 경쟁 모델을 앞선 것은 아니에요
가격입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러부터예요API 비용을 비교할 때 속도가 2배 가격인 fast 변형도 따로 봐야 해요

1. Grok 4.6은 사후 학습에 승부를 걸었어요

xAI는 Grok 4.6이 Grok 4.5를 바탕으로 만들어졌다고 밝혔어요. 추가 학습 기간을 늘리고, 추론과 고급 기술 개념을 다루는 모델 생성 데이터와 엔지니어링 데이터를 넣었어요. 옵티마이저와 학습 방식도 손봤어요. 그 뒤 Grok 4.5로 추론, 소프트웨어 엔지니어링, STEM, 지식 노동 영역의 SFT 실행 기록을 다시 만들고 문제가 있는 기록은 모델 기반 검사로 걸러냈어요. 2

강화학습 과제도 일반 코딩에 머물지 않았어요. 커널 최적화, 웹 개발, 컴퓨터 지원 설계처럼 작업 환경이 다른 분야를 포함했어요. 공개 설명만 보면 Grok 4.6의 변화는 모델 규모 확대보다 학습 데이터 선별과 실행 기록의 품질 관리에 가까워요. 다만 기반 모델의 정확한 파라미터 수는 공식 발표문에 나오지 않아요. 외부 추정치를 공식 사실처럼 받아들이면 안 돼요.

728x90

xAI는 긴 작업에서 모델이 다음 단계로 넘어가기 전에 결과를 직접 시험하고 확인하는 행동이 늘었다고 설명했어요. 낯선 분야를 조사하고 앱 구조를 잡은 뒤 핵심 기능을 구현하며, 여러 차례 피드백을 반영하는 프로젝트를 주요 사용 사례로 들었어요. 개발자로서는 짧은 코드 생성보다 여러 파일과 단계가 얽힌 작업에서 얼마나 안정적으로 맥락을 유지하는지가 실제 평가 포인트예요.

벤치마크 결과는 장점과 한계를 함께 보여줘요. Grok 4.6 High는 아홉 개 평가를 합산한 Artificial Analysis Intelligence Index에서 61점을 기록했어요. GPT-5.6 Sol Max와 같은 점수예요. CursorBench 3.2는 69.9%로 GPT-5.6 Sol Max의 67.2%보다 높았지만, DeepSWE 1.1은 65.9%로 73%보다 낮았어요. Terminal-Bench 3.0도 26%로 34.6%에 미치지 못했어요. 모델 하나가 모든 개발 작업에서 우세하다고 결론 내리기 어려운 결과예요. 경쟁 모델 수치까지 각 개발사의 공개 자료에서 가져온 비교이며, Grok 수치는 xAI가 직접 공개했다는 점도 고려해야 해요. 2

Grok 4.6은 Cursor와 Grok Build에서 바로 쓸 수 있어요. API와 OpenRouter, Vercel, Cloudflare를 통한 제공도 시작됐어요. 기본 API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러예요. fast 변형은 이 가격의 2배예요. 첫 주에는 Cursor와 Grok Build의 포함 사용량을 2배로 제공해요. 실제 도입 전에는 공개 점수만 비교하지 말고, 팀의 코드베이스에서 수정 정확도와 재시도 횟수, 총 토큰 비용을 함께 재보는 편이 좋아요.

왜 중요한가요

Grok 4.6은 더 큰 기반 모델을 내세우지 않고도 사후 학습 설계로 체감 성능을 개선하려는 흐름을 보여줘요. 코딩 모델 경쟁도 한 번의 정답률보다 긴 작업을 끝까지 이어가는 능력, 자체 점검, 도구 사용 안정성으로 옮겨가고 있어요. 2

개발팀이 볼 지점은 벤치마크 1위 여부보다 작업별 편차예요. 초기 앱 구현과 일부 코딩 평가에서는 강한 결과가 나왔지만, 저장소 단위 소프트웨어 작업과 터미널 과제에서는 더 높은 점수를 낸 경쟁 모델이 있어요. 같은 모델이라도 작업 종류에 따라 성공률과 비용이 달라질 수 있어요. 작은 실제 과제를 정해 결과 품질, 수정 횟수, 처리 시간, 최종 비용을 함께 기록하면 모델 선택이 쉬워져요.

참고 자료

  1. Grok 4.6 공개, 파라미터 확장 대신 사후 학습에 투자한 모델 — GeekNews
  2. Introducing Grok 4.6 — SpaceXAI
728x90