하루 1,500억 이벤트를 견딘 StreamHub, Kafka 전환 뒤 드러난 병목
하루 1,500억 이벤트를 견딘 StreamHub, Kafka 전환 뒤 드러난 병목AI 뉴스 썸네일Atlassian의 이벤트 스트리밍 플랫폼 StreamHub는 하루 220억 건을 처리하던 시스템에서 하루 1,500억 건을 수집하는 플랫폼으로 커졌어요. Kinesis가 안정적으로 맡아 온 구간을 넘어선 뒤에는 AWS MSK 기반 Kafka와 계층형 저장소를 선택했어요. 전환 뒤에도 브로커 네트워크, S3 요청, 관리형 서비스의 제어 영역이 새 병목으로 나타났어요. 1핵심 요약구분핵심왜 볼 만한가요처리 규모StreamHub는 하루 1,500억 건을 수집하고 2,250억 건 넘게 전달해요평균 초당 168만 건, 최대 초당 320만 건을 다룬 운영 사례예요전환 배경Kinesis의 샤드 비용, 장기 보관 비용,..
데이터 도구를 이름 대신 흐름으로 이해하는 법
데이터 도구를 이름 대신 흐름으로 이해하는 법AI 뉴스 썸네일데이터 프로젝트에 처음 들어가면 제품 이름부터 쏟아져요. dbt, Spark, Kafka, Airflow가 한 문장에 섞이면 각 도구가 같은 일을 하는지조차 헷갈리기 쉬워요. 최근 공개된 데이터 도구 지형 가이드는 도구 목록 대신 데이터가 이동하는 순서로 이 생태계를 설명해요. 1핵심 요약구분맡는 일대표 선택지수집원천 시스템의 데이터를 목적지로 옮겨요Airbyte, dlt, Fivetran, Debezium저장분석용 데이터를 비용과 성능 조건에 맞춰 보관해요Snowflake, BigQuery, S3, Iceberg, Delta Lake처리데이터를 정제하고 집계하거나 실시간으로 계산해요dbt, DuckDB, Spark, Flink실행 관리작업 순..