データエンジニアリング
失敗しても安全なパイプラインから始め、SparkとHadoopの実行計画、Icebergテーブルのスナップショット、Flinkの状態とチェックポイント、ClickHouseの格納構造まで、エンジンが残した数字で判断する方法を身につけます。終えると「データがおかしい」という報告を受けたとき、どの段階で何が狂ったかを数字で絞れるようになります。
코스
- データパイプライン — 失敗して再実行しても結果が同じでなければなりません
- Apache Spark — 遅いジョブの答えは実行計画とイベントログにある — ローカルモードのSparkでシャッフル・結合・偏りをイベントログで測る
- Apache Hadoop — 1つのPodにHDFSとYARNを立てて運用する — 疑似分散のHDFS・YARNでブロック・権限・クォータ・MapReduceを手で
- レイクハウスのテーブル形式 — Apache Iceberg をメタデータで理解する — スナップショット・スキーマ進化・パーティション進化・MERGE・メンテナンスをメタデータで確かめる
- Apache Flink — ストリームを本物のエンジンで動かす — ウォーターマーク・状態・チェックポイントをエンジンの出力で確かめる
- ClickHouse — 列指向分析 DB を中身から — ソートキー・パート・マージを system テーブルの数字で読む