데이터 엔지니어링
실패해도 안전한 파이프라인에서 시작해 Spark·Hadoop 의 실행 계획, Iceberg 표의 스냅샷, Flink 의 상태와 체크포인트, ClickHouse 의 저장 구조까지 엔진이 남긴 숫자로 판단하는 법을 익힙니다. 끝나면 '데이터가 이상하다'는 신고를 받았을 때 어느 단계에서 무엇이 틀어졌는지 숫자로 좁혀 갈 수 있게 됩니다.
코스
- 데이터 파이프라인 — 실패하고 다시 돌려도 결과가 같아야 합니다
- Apache Spark — 느린 잡의 답은 실행 계획과 이벤트 로그에 있다 — local 모드 Spark 로 셔플·조인·쏠림을 이벤트 로그로 잰다
- Apache Hadoop — HDFS 와 YARN 을 한 파드에 세우고 운영한다 — 의사 분산 HDFS·YARN 으로 블록·권한·쿼터·맵리듀스를 손으로
- 레이크하우스 표 형식 — Apache Iceberg 를 metadata 로 이해한다 — 스냅샷·스키마 진화·파티션 진화·MERGE·정리를 metadata 로 확인
- Apache Flink — 스트림을 엔진으로 돌린다 — 워터마크·상태·체크포인트를 진짜 엔진의 출력으로 확인합니다
- ClickHouse — 열 지향 분석 DB 를 속까지 — 정렬 키·파트·병합을 system 표의 숫자로 읽습니다