拓冰建站拓冰建站
首页 / 资讯中心 / 正文

数据工程学习路径指南:从搭环境到流处理的 6 个步骤,拆解 data-engineer-handbook 的 30+ 份资源

数据工程学习路径指南从搭环境到流处理的 6 个步骤拆解 contenteditable="false">【免费下载链接】data-engineer-handbookThis is a repo with links to everything youd ever want to learn about data engineering项目地址: https://gitcode.com/GitHub_Trending/da/data-engineer-handbookdata-engineer-handbook 仓库集中收录了数据工程的学习资源从零基础的 SQL、Python到进阶的数据建模、Spark、Flink 实战外加 25 本参考书、社区与 Newsletter、面试材料。本文不按理论/工具/架构分堆而是按你实际学习的阶段拆成 6 个步骤每一步都指明该读什么、练什么照着走就行。️ 第 1 步搭好本地环境让数据库先跑起来新手最常见的卡点不是知识而是环境。这个仓库把环境要求压到了两条能跑 Docker以及 Python 3.11见 软件要求。建议把仓库克隆下来再动手git clone https://gitcode.com/GitHub_Trending/da/data-engineer-handbook.git然后直接复用仓库里现成的容器编排不用自己装数据库docker-compose.yml一条命令拉起 PostgreSQL PGAdmin免去手工配置初始化脚本 负责建库example.env账号密码模板复制为.env即可连接避免每次手填凭据维度建模实验说明排错手册端口占用、容器连不上等常见报错都给了对应修复命令初始化数据库 data.dump样例数据pg_restore恢复后就有完整的球员、球队表可练手连接成功后PGAdmin 里应能看到服务器节点展开出数据库和表 第 2 步用 SQL 练数据建模把维度和事实分清建模是数据工程面试和实践的硬通货。仓库的中级训练营把建模拆成了两块练习SQL 全部可以直接跑练习材料解决的问题SCD 生成查询如何把同一实体不同时期的快照存成可回溯的历史记录增量 SCD 查询每天只处理变更行避免全表重算图数据库 DDL球员-球队关系类数据怎么组织维度建模的核心思想——事实表记录发生了什么、维度表描述在什么背景下——可以用这张课堂笔记图快速建立印象维度数据建模事实表与维度表关系的白板笔记建模练熟后接着练查询套路。分析模式练习 里的四个文件各自对应一类业务问题留存分析 retention_analysis.sql用户第 N 天还回来多少窗口函数 日期偏移的标准写法漏斗分析 funnel_analysis.sql各步骤转化率怎么算多事件序列对齐分组聚合 grouping_sets.sql一次查询出多种粒度的汇总替代多次 GROUP BY 再 UNION增长核算 growth_accounting.sql新用户/回流用户拆解结合累计用户表的建表思路事实表这一侧事实数据建模练习 覆盖了累计表、数组指标两类容易写错的表每份 SQL 都能直接对照跑。⚡ 第 3 步用 Python 和 Spark 把管道跑起来单机 SQL 练完下一步是批量处理框架。仓库里的 Spark 模块是作业 测试的结构适合照着写月度站点命中作业第一个 PySpark 管道样例读 events 数据、聚合、写回Iceberg bucket join 笔记本大表关联为什么慢分桶策略对 join 性能的影响作业测试 test_monthly_user_site_hits.py管道怎么验证测试写法可以直接套用到自己的作业上Spark 缓存笔记本反复读同一份数据贵不贵缓存与广播变量的取舍想理解框架底层在干什么配合仓库 书单 里的三本Designing Data-Intensive Applications分布式系统为什么这么设计一致性、复制、分区的全景讲解High Performance Spark任务跑得慢从哪下手Shuffle、内存、数据倾斜的优化手段Streaming Systems批处理思路为什么在流上失效Kafka、Flink 等系统的共性原理 第 4 步让数据实时更新Flink 流处理批管道只能每天知道流处理才能现在就知道。仓库的 Flink 模块是一个可运行的最小流作业聚合作业第一个 Flink 程序对事件流做窗口聚合代码量小、能看出全貌初始化 SQL流作业依赖的表结构配合 docker-compose.yml 一键起依赖延伸阅读Stream Processing with Apache Flink书单收录Flink 的窗口、状态、容错从会跑到懂原理 第 5 步用书单和 Newsletter 补齐体系练习解决怎么做书解决为什么。books.md 共 25 本按当前阶段挑 2-3 本就够刚入门 →Fundamentals of Data Engineering数据系统设计原则一次讲全适合通读主攻数仓 →Kimball - The Data Warehouse Toolkit维度建模方法论源头与第 2 步练习互相对照关注平台架构 →Data Mesh、Data Management at Scale大型组织里数据平台怎么分工面向 ML 方向 →The Hundred Page Machine Learning Book篇幅短适合快速建立 AI 基础概念保持手感靠订阅。newsletters.md 列了 25 份 Newsletter优先看 Data Engineering Weekly、Seattle Data Guy 这类周更型每封邮件读完五分钟工具选型和行业动向就不会断档。 第 6 步做一个完整项目对着面试清单自检简历上的会 Spark和能讲清一个端到端项目差距很大。projects.md 里的项目都带完整流程数据摄取、清洗、存储、可视化、编排选一个跟完比看十个教程更有效。求职前用 interviews.md 自检——它把数据工程面试拆成四类轮次SQL、数据建模、数据架构、数据结构与算法每类都给了准备思路。系统设计方向的候选人可加一本Machine Learning System Design Interview书单收录。如果对 AI 方向感兴趣仓库还有一组独立的 Databricks AI 训练营三天依次搭 Lakebase 应用、向量检索、端到端 AI 应用每天一个可交付物。行动清单本周克隆仓库完成第 1 步在本地 PG 里跑通第一条查询第 2-3 周第 2 步的建模与分析练习每份 SQL 都改一遍再跑第 4-5 周第 3 步写一个自己的 PySpark 作业并补上对应测试第 6 周起第 4 步的 Flink 作业 从书单里挑 1 本开始读投递前过一遍 interviews.md 的四个轮次确保每类都能讲出至少一个项目实例【免费下载链接】data-engineer-handbookThis is a repo with links to everything youd ever want to learn about data engineering项目地址: https://gitcode.com/GitHub_Trending/da/data-engineer-handbook创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门