본문 바로가기

IT & AI

Uber는 PR 70% 이상을 AI로 처리하며 비용을 어떻게 줄였나

728x90

Uber는 PR 70% 이상을 AI로 처리하며 비용을 어떻게 줄였나

AI 뉴스 썸네일
AI 뉴스 썸네일
728x90

AI 코딩 도구를 넓게 쓰면 사용량과 청구액이 함께 커지기 쉬워요. Uber는 주간 AI 사용자와 요청이 빠르게 늘어난 상황에서도 모델 선택, 컨텍스트 관리, 도구 호출 방식을 함께 손봐 단위 비용을 낮췄어요. 2

핵심 요약

구분핵심왜 볼 만한가요
도입 규모PR의 70% 이상을 로컬 또는 클라우드 AI가 담당해요일부 개발자의 보조 도구를 넘어 조직 전체 운영 사례를 보여줘요
비용 관리실제 업무 벤치마크로 작업별 모델을 고르고 저렴한 모델에 범위가 명확한 일을 나눠요가장 비싼 모델 하나에 모든 요청을 보내지 않아도 품질을 관리할 수 있어요
컨텍스트400K 토큰에서 대화를 압축하고 필요한 도구 정보만 불러와요긴 세션과 많은 도구가 만드는 반복 입력 비용을 줄여요
측정 기준토큰 가격보다 완료 작업당 비용과 품질을 함께 봐요코드 리뷰와 장애 대응처럼 서로 다른 업무를 같은 기준으로 비교하지 않아요

1. AI 사용량이 늘어도 비용을 통제한 Uber의 운영법

Uber가 공개한 수치는 이미 개인용 코딩 보조의 범위를 벗어나 있어요. 로컬·클라우드 AI가 전체 PR의 70% 이상에 관여해요. 엔지니어가 만든 스킬은 3,600개가 넘고 하루 실행 횟수는 3만 회를 넘어요. 2026년 2월부터 8월 중순까지 주간 사용자는 7배, 요청은 9.4배 늘었어요. 같은 모델을 고정해 비교했을 때 요청 1,000건당 비용은 정점보다 약 34%, 세션당 비용은 6월 정점보다 52% 낮아졌어요. 2

가장 비싼 모델을 모든 일에 쓰지 않아요

Uber는 토큰 가격표만 보고 모델을 고르지 않아요. 실제 코드 리뷰와 모노레포 PR로 벤치마크를 만들고, 완료 작업당 비용·출력 품질·신뢰성을 함께 비교해요. 주 모델은 작업을 나누고 결과를 평가해요. 입력과 범위가 분명한 실행은 더 저렴한 하위 모델에 맡겨요. 모델이 새로 나오면 같은 벤치마크로 다시 비교해 선택을 바꿔요. 1

이 방식은 코드 리뷰처럼 정답을 비교할 수 있는 업무에서 특히 구체적이에요. Uber의 uReview는 알려진 버그가 들어 있는 실제 PR을 난이도별로 나눠 정밀도, 재현율, F1 점수, 리뷰 비용, 지연 시간, 타임아웃을 함께 재요. 단가가 낮다는 이유만으로 품질이 떨어지는 모델을 고르지 않고, 품질 개선 폭에 비해 비용이 지나치게 큰 모델도 피할 수 있어요. 2

긴 대화와 도구 목록에서 새는 토큰을 줄여요

긴 세션은 요청마다 대화 기록과 프로젝트 정보, 도구 결과를 다시 보내요. Uber는 100만 토큰 컨텍스트를 지원하는 모델도 400K 토큰에서 자동 압축해요. 추론 강도는 대부분의 작업에서 중간값을 기본으로 둬요. 사람이 쓰는 대화형 세션은 한 시간 캐시를 쓰고, 짧게 끝나는 하위 작업은 5분 캐시를 유지해 각 사용 패턴에 맞췄어요. 2

도구가 많을 때는 목록 자체도 비용이 돼요. 100개가 넘는 도구 설명을 미리 넣으면 첫 입력에 약 5만~7만 토큰이 추가될 수 있어요. Uber는 1,000개가 넘는 MCP 도구를 CLI 명령으로 노출하고 필요한 도구만 실행 시점에 찾아요. 여러 호출은 하나의 스크립트로 묶어 중간 상태 확인과 원본 응답이 대화에 계속 쌓이지 않게 해요. 동일한 SQL 작업에서는 작은 결과도 토큰이 50% 넘게 줄었고, 반복 작업에서는 절감 폭이 90%를 넘었어요. 2

코드보다 먼저 찾는 시간을 줄여요

대규모 코드베이스에서는 코드를 쓰는 시간보다 서비스 소유자, 데이터셋, 과거 장애 기록을 찾는 시간이 길 수 있어요. Uber는 30개가 넘는 사내 시스템을 연결한 AI Context Graph를 운영해요. 이 그래프는 2,400만 개 노드와 8,000만 개 연결로 서비스, 팀, 장애 기록, PR, 설계 문서, 배포, 데이터셋을 잇고 있어요. 2

같은 질문에 그래프를 연결한 모델은 38초 만에 올바른 테이블을 찾았어요. 그래프가 없던 모델은 20분 동안 서비스 코드를 뒤지고도 잘못된 결론을 냈어요. 모델 호출 횟수만 줄이는 대신 첫 요청에 정확한 조직 정보를 주면 품질과 비용을 같이 개선할 수 있다는 사례예요. 2

왜 중요한가요

AI 코딩 비용은 사용자 수에 토큰 단가를 곱하는 문제로 끝나지 않아요. 한 세션의 턴 수, 턴마다 생기는 요청 수, 요청마다 반복되는 입력량이 서로 곱해져 총액을 만들어요. 따라서 모델 할인만 기다리기보다 불필요한 탐색, 반복 호출, 과도한 컨텍스트를 각각 측정해야 해요. Uber는 사용자당 비용보다 병합된 PR, 코드 리뷰, 처리한 경보처럼 완료 결과 하나에 얼마가 들었는지도 함께 봐요. 2

규모가 작은 팀도 원칙은 적용할 수 있어요. 먼저 자주 반복되는 코드 리뷰나 CI 복구처럼 결과를 확인하기 쉬운 업무를 고르면 돼요. 실제 작업으로 모델을 비교하고, 범위가 좁은 단계에는 저렴한 모델을 배치해요. 세션에 들어가는 도구 설명과 중간 결과도 측정하면 어디서 비용이 늘어나는지 찾기 쉬워져요. 다만 Uber의 절감 수치는 자체 코드베이스와 조직 구조에서 나온 값이라 다른 팀에서 같은 비율을 기대하기는 어려워요. 2

참고 자료

  1. Uber 규모의 소프트웨어 팩토리를 효율적으로 운영하는 법 — GeekNews
  2. Running a Software Factory Efficiently at Uber Scale — Uber Engineering
728x90