数据工程
从失败后仍然安全的流水线开始,学会依据引擎留下的数字做判断 — Spark 与 Hadoop 的执行计划、Iceberg 表的快照、Flink 的状态与检查点、ClickHouse 的存储结构。学完后收到「数据不对」的报告时,能用数字收敛到是哪个阶段出了问题。
코스
- 数据流水线 — 失败后重跑,结果必须一样
- Apache Spark — 慢作业的答案在执行计划和事件日志里 — 用本地模式 Spark 通过事件日志测量 shuffle、连接与数据倾斜
- Apache Hadoop — 在一个 Pod 里搭起并运维 HDFS 与 YARN — 在伪分布式 HDFS·YARN 上亲手操作块、权限、配额与 MapReduce
- 湖仓表格式 — 从元数据理解 Apache Iceberg — 用元数据验证快照、模式演进、分区演进、MERGE 与表维护
- Apache Flink — 用真正的引擎跑流处理 — 用引擎自己的输出验证水位线、状态和检查点
- ClickHouse — 从内部理解列式分析数据库 — 用 system 表里的数字读懂排序键、数据部分与合并