본문 바로가기

728x90

ApacheArrow

(3)
데이터 도구를 이름 대신 흐름으로 이해하는 법 데이터 도구를 이름 대신 흐름으로 이해하는 법AI 뉴스 썸네일데이터 프로젝트에 처음 들어가면 제품 이름부터 쏟아져요. dbt, Spark, Kafka, Airflow가 한 문장에 섞이면 각 도구가 같은 일을 하는지조차 헷갈리기 쉬워요. 최근 공개된 데이터 도구 지형 가이드는 도구 목록 대신 데이터가 이동하는 순서로 이 생태계를 설명해요. 1핵심 요약구분맡는 일대표 선택지수집원천 시스템의 데이터를 목적지로 옮겨요Airbyte, dlt, Fivetran, Debezium저장분석용 데이터를 비용과 성능 조건에 맞춰 보관해요Snowflake, BigQuery, S3, Iceberg, Delta Lake처리데이터를 정제하고 집계하거나 실시간으로 계산해요dbt, DuckDB, Spark, Flink실행 관리작업 순..
Pandas 창시자가 본 AI 코딩의 한계, 코드보다 판단력이 남아요 Pandas 창시자가 본 AI 코딩의 한계, 코드보다 판단력이 남아요AI 뉴스 썸네일Pandas를 만든 웨스 맥키니는 AI가 코드를 빠르게 늘려도 좋은 소프트웨어를 판별하는 일까지 대신해 주지는 못한다고 말해요. Apache Arrow와 DuckDB 같은 데이터 시스템이 오래 살아남는 이유도 구현량보다 설계, 검토, 신뢰에 있어요. 1핵심 요약구분핵심왜 볼 만한가요AI 코딩LLM은 익숙한 해법을 빠르게 제시하지만 목표와 품질 기준은 개발자가 정해야 해요생성 속도보다 검토 능력이 병목이 되는 이유를 보여줘요데이터 시스템Apache Arrow는 시스템 사이의 표 형식 데이터를 잇는 공통 계층으로 자리 잡았어요여러 도구가 같은 형식을 채택할수록 연결 비용이 줄어요오픈소스DuckDB와 DataFusion의 경쟁..
LLM 작업을 데이터프레임 쿼리로 다루는 fenic LLM 작업을 데이터프레임 쿼리로 다루는 fenicfenic 시맨틱 데이터프레임 썸네일문서 분류나 요약을 LLM에 맡기다 보면 데이터 처리 코드와 모델 호출 코드가 금세 뒤섞여요. 오픈소스 프로젝트 fenic은 이 작업을 데이터프레임 쿼리 안으로 가져와요. 익숙한 SQL식 연산과 의미 기반 연산을 한 파이프라인에서 실행하고, 결과가 나온 과정과 비용도 다시 확인할 수 있게 만들었어요. 1핵심 요약구분핵심왜 볼 만한가요쿼리 모델일반 데이터 연산과 LLM 기반 연산을 함께 작성해요데이터 전처리와 모델 호출을 따로 이어 붙이는 코드를 줄일 수 있어요타입과 스키마비정형 텍스트를 Pydantic 스키마에 맞춘 컬럼으로 바꿔요모델 출력이 다음 처리 단계에서 어떤 형태여야 하는지 명시할 수 있어요실행 관리배칭, 재시..

728x90