본문 바로가기

IT & AI

GPT-5.6 가격 인하, 기업 AI는 모델보다 작업 배치가 중요해졌어요

728x90

GPT-5.6 가격 인하, 기업 AI는 모델보다 작업 배치가 중요해졌어요

IT & AI 뉴스 썸네일
IT & AI 뉴스 썸네일

OpenAI가 GPT-5.6 Luna의 API 가격을 80%, Terra는 20% 내렸어요. Sol에는 최대 2.5배 빠른 Fast mode를 추가했어요. 이제 기업은 모든 작업에 가장 강한 모델을 붙이기보다, 계획과 구현처럼 단계가 다른 일을 어느 모델에 맡길지 더 세밀하게 정할 수 있어요. 1

핵심 요약

구분핵심왜 볼 만한가요
가격Luna는 100만 토큰당 입력 0.20달러, 출력 1.20달러예요반복 작업과 대량 처리를 적은 예산으로 시험할 수 있어요
모델 선택Terra는 균형형, Luna는 빠르고 저렴한 실행형, Sol은 복잡한 추론형으로 나뉘어요한 업무 안에서도 단계별로 다른 모델을 배치할 근거가 생겨요
속도Sol Fast mode는 지능 수준을 유지하면서 표준 처리보다 최대 2.5배 빨라요응답 지연이 비용으로 이어지는 서비스가 선택지를 얻어요
운영모델과 추론 시스템, 맥락 관리 효율을 함께 손봤어요토큰 단가만이 아니라 작업 한 건의 총비용을 비교해야 해요

1. GPT-5.6 가격표가 모델 선택 방식을 바꿔요

7월 30일부터 Luna의 API 요금은 100만 토큰당 입력 0.20달러, 출력 1.20달러로 내려갔어요. Terra는 입력 2달러, 출력 12달러예요. OpenAI는 Luna 가격을 80%, Terra 가격을 20% 낮췄다고 밝혔어요. Sol의 기본 가격은 그대로예요. ChatGPT Work와 Codex 구독료도 바뀌지 않지만, Luna와 Terra를 쓸 때 차감되는 크레딧은 줄어요. 2

OpenAI가 공개한 비교에서 Luna는 1년 전 최상위권 모델과 비슷한 성능을 작업당 약 6%의 비용으로 냈어요. 처리 속도는 거의 9배였어요. 전문 업무 평가인 Agents' Last Exam에서는 Fable 5보다 높은 점수를 기록하면서 추정 작업 비용은 약 99% 낮았어요. 이 수치는 OpenAI가 선택한 평가와 비용 계산을 바탕으로 하므로, 실제 도입 전에는 회사 업무와 같은 데이터로 다시 측정해야 해요. 1

Sol의 Fast mode는 기존 Priority Processing을 대체해요. 지능 설정을 낮추지 않고 표준 처리보다 최대 2.5배 빠른 응답을 2배 가격에 제공해요. 기존 API 요청에서 `priority` 태그를 사용하던 경우도 계속 작동해요. 속도가 매출이나 고객 대기 시간에 직접 연결되는 요청에는 Fast mode가 맞을 수 있어요. 비동기 보고서나 야간 배치처럼 기다릴 수 있는 작업에는 표준 처리가 더 경제적이에요. 2

가격 인하의 배경에는 모델 자체만이 아니라 실행 시스템 개선도 있어요. OpenAI는 요청 라우팅과 하드웨어 활용, 토큰 생성 소프트웨어, 맥락 관리를 함께 최적화했다고 설명했어요. Sol이 프로덕션 커널 개선을 돕는 과정에서 모델 제공 비용을 20% 줄였고, 별도 실험으로 토큰 생성 효율을 15% 이상 높였다는 수치도 공개했어요. 회사가 밝힌 내부 측정치라서 외부에서 같은 결과를 재현할 수 있는지는 따로 봐야 해요. 3

기업이 바로 적용할 만한 방식은 한 가지 모델로 통일하는 대신 작업 단계를 나누는 거예요. 요구사항이 모호하거나 실패 비용이 큰 계획 단계에는 Sol을 쓸 수 있어요. 변경 범위가 정해진 구현, 테스트 작성, 결과 분류처럼 검증 기준이 뚜렷한 단계에는 Luna를 붙일 수 있어요. 일반 업무는 Terra로 시작하고, 품질 기준을 넘지 못한 요청만 Sol로 넘기는 방식도 가능해요. 모델 이름보다 오류 비용, 응답 시간, 작업량을 기준으로 라우팅해야 비용 인하가 실제 운영비 절감으로 이어져요.

728x90

왜 중요한가요

Luna의 낮아진 가격은 같은 예산으로 더 많은 후보를 만들고 비교할 여지를 줘요. 문서 분류, 고객 문의 태깅, 테스트 생성처럼 결과를 자동으로 검사할 수 있는 작업은 여러 번 실행해 일치도를 확인하는 방법도 쓸 수 있어요. 다만 호출 횟수가 늘면 저장, 평가, 모니터링 비용도 함께 늘어요. 토큰 단가만 보고 전체 비용이 같은 비율로 줄었다고 계산하면 안 돼요. 4

모델 라우팅에는 평가 기준이 먼저 필요해요. Luna가 통과해야 할 정확도와 허용 지연 시간을 정하고, 실패한 요청을 Terra나 Sol로 올리는 규칙을 두는 편이 안전해요. 코딩 작업이라면 테스트 통과율, 재시도 횟수, 사람이 고친 줄 수를 함께 기록할 수 있어요. 고객 응대라면 잘못 분류한 비율과 검수 시간을 봐야 해요. 이런 지표가 있어야 저렴한 모델이 정말 같은 결과를 내는 구간을 찾을 수 있어요.

이번 발표에서 확인할 부분도 남아 있어요. OpenAI가 제시한 성능과 비용 비교가 각 회사의 데이터에서도 유지되는지, Fast mode의 지연 시간 개선이 트래픽이 몰릴 때도 안정적인지 봐야 해요. 가격은 즉시 비교할 수 있지만, 결과 한 건을 완료하는 비용은 도구 호출 수와 재시도, 사람 검수까지 포함해야 드러나요.

참고 자료

  1. GPT-5.6, 가격 대비 성능의 한계를 확장 — GeekNews
  2. Advancing the price-performance frontier with GPT-5.6 — OpenAI
  3. GPT-5.6 frontier intelligence efficiency — OpenAI
  4. OpenAI API pricing — OpenAI
728x90