拓冰建站拓冰建站
首页 / 资讯中心 / 正文

27. 数据产品-数据仓库简介

文章目录前言一、基础概念1. 数据仓库 DW2. 四大经典特性数仓基石3. 常用名词二、主流数仓架构3 种1. 传统离线架构最常用2. 实时数仓架构现在主流3. 湖仓一体架构大厂趋势三、标准数仓分层必背面试工作通用1. ODS 层 原始数据层2. DWD 层 明细清洗层3. DWS 层 汇总轻度聚合层4. ADS 层 应用指标层5. DIM 层 维度层四、完整数据流转全流程五、离线数仓 vs 实时数仓 核心区别六、工作常用数据源对应落地七、最简技术路线前言数据仓库 DW‌。一、基础概念1. 数据仓库 DW定义面向分析、决策整合全业务多源数据做统一存储、清洗、汇总的数据集合特点面向主题、集成性、稳定性、时变性和数据库区别数据库MySQLOLTP 事务业务增删改查、日常交易数仓OLAP 分析查询统计、报表、指标、用户画像2. 四大经典特性数仓基石面向主题按业务域划分用户、订单、商品、流量不按系统划分集成性统一清洗、统一格式、统一编码抹平多源差异非易失稳定以追加写入为主极少删除修改保留历史随时间变化自带时间维度可回溯每日 / 每月数据3. 常用名词ETL抽取 Extract→转换 Transform→加载 Load传统离线ELT抽取 Extract→加载 Load→转换 Transform现代数仓主流先入库再清洗维度分析角度时间、地区、用户、渠道指标聚合数值订单量、销售额、UV、转化率事实表存放业务行为明细订单明细、点击日志维度表存放基础属性用户信息、商品分类数据集市 DM数仓子集给业务部门单独使用二、主流数仓架构3 种1. 传统离线架构最常用数据源 → 采集层 → 计算层 → 数仓分层 → 应用层采集DataX、Sqoop、Flume、Canal存储HDFS计算Hive、Spark调度Azkaban、DolphinScheduler查询Presto、Impala2. 实时数仓架构现在主流实时数据源 (Kafka) → Flink 实时计算 → 实时存储 → 实时报表实时存储ClickHouse、Doris、StarRocks、TiDB3. 湖仓一体架构大厂趋势数据湖原始海量明细 数据仓库结构化分层指标数据湖存原始全量数据廉价、格式灵活数仓做规整分层供业务分析三、标准数仓分层必背面试工作通用1. ODS 层 原始数据层作用原样同步原始数据不清洗、不转换来源MySQL、日志、API、MongoDB特点数据杂乱、冗余大、结构贴近源系统命名ods_xxx2. DWD 层 明细清洗层作用清洗脏数据、过滤无效数据、字段脱敏、格式统一输出干净标准化业务明细数据命名dwd_xxx3. DWS 层 汇总轻度聚合层作用按维度轻度汇总按天、按小时、按渠道产出宽表、行为汇总表命名dws_xxx4. ADS 层 应用指标层作用最终业务指标直接给报表、大屏、BI产出日报、周报、营收、流量、用户指标命名ads_xxx5. DIM 层 维度层独立存放用户维度、商品维度、地区维度、时间维度分层口诀原始 ODS → 清洗 DWD → 汇总 DWS → 指标 ADS四、完整数据流转全流程数据产生业务系统、APP 埋点、服务器日志、物联网设备、第三方接口数据采集数据库Canal 监听 Binlog 增量同步日志Flume 采集推送 Kafka文件 / 批量DataX 全量同步数据中转统一存入Kafka做削峰、解耦、实时缓冲数据计算处理离线Hive/Spark 跑 T1 凌晨任务实时Flink 实时清洗、聚合、关联分层入库依次写入 ODS→DWD→DWS→ADS数据服务应用自助 BI 报表运营后台指标实时监控大屏用户画像、数据分析、风控模型五、离线数仓 vs 实时数仓 核心区别离线数仓Hive 为主时效T1次日看昨日数据场景日报、月报、大盘复盘、历史回溯优点数据量大、稳定、成本低缺点延迟高实时数仓ClickHouse/Doris 为主时效秒级 / 分钟级场景实时流量、直播大屏、实时交易额、告警监控优点速度快、响应及时缺点存储成本高不适合超久历史明细六、工作常用数据源对应落地MySQL/PG/SQLServer/Oracle → 同步进 ODS 离线层埋点日志、系统日志 → 进 Kafka → 实时清洗入 ClickHouseAPI 接口数据 → 定时抓取入数仓手工 Excel 表 → 导入 ODS 做业务补数MongoDB → 同步清洗进明细层七、最简技术路线吃透数仓四层分层含义与建表思路掌握事实表、维度表、宽表设计学会 Hive 建表、分区、分桶、常用函数了解 Flink 实时流转流程分清 Hive 离线、ClickHouse 实时使用场景学习数据同步、调度、数据质量基础
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门