NVIDIATriton (1) 썸네일형 리스트형 넷플릭스는 vLLM을 어떻게 프로덕션에 올렸을까요 넷플릭스는 vLLM을 어떻게 프로덕션에 올렸을까요AI 뉴스 썸네일넷플릭스가 사내 LLM 서빙 플랫폼의 구조와 운영 경험을 공개했어요. vLLM을 고르는 데서 끝나지 않고, 기존 ML 인프라와 연결한 방식부터 무중단 배포, 메트릭 통합, 제약 디코딩 병목까지 구체적으로 다뤘어요. 1핵심 요약구분핵심왜 볼 만한가요서빙 구조기존 JVM 서빙 계층과 Triton 위에 vLLM을 연결했어요LLM만을 위한 별도 운영 체계를 만들지 않고 기존 배포·상태 확인·자동 확장 기능을 재사용했어요엔진 선택TensorRT-LLM에서 vLLM을 기본 경로로 바꿨어요최고 처리량 하나보다 사용자 정의 모델, 디버깅, 확장 훅, 연구 환경과의 연결 비용을 함께 봤어요APIgRPC와 OpenAI 호환 HTTP API를 함께 열었어요기존.. 이전 1 다음