所属 Stage · 基础认知
仓库问题与术语
为什么学 分不清 OLTP / OLAP 与 ETL / ELT 的职责时,容易把交易系统的即时查询直接当成经营分析口径。
学完应能 判断一个分析问题该由业务系统处理,还是需要数据仓库承接。
预计 22 分钟 · 2 节
对应课程
知识前置
本主题没有必需的前置主题。
LEARNING ROADMAP · KNOWLEDGE MAP
从主题而不是课程序号出发,浏览数据仓库知识如何相互支撑。每个 Topic 都连接到现有课程,关系用于学习参考,不限制访问。
Stage 只是内容分组,顺序不代表前置;只有 Topic 关系表达知识依赖。所有课程都可以直接打开。
STAGE 01 · 浏览分组
所属 Stage · 基础认知
为什么学 分不清 OLTP / OLAP 与 ETL / ELT 的职责时,容易把交易系统的即时查询直接当成经营分析口径。
学完应能 判断一个分析问题该由业务系统处理,还是需要数据仓库承接。
预计 22 分钟 · 2 节
本主题没有必需的前置主题。
所属 Stage · 基础认知
为什么学 不清楚每层各自负责什么时,容易把清洗、汇总和指标口径堆在一起,一处改动牵动全链路。
学完应能 识别一个报表数字经过的加工层,判断问题应该在哪一层解决。
预计 22 分钟 · 2 节
讨论公共加工如何支撑多个消费者,需要先理解数据仓库解决的跨系统分析问题。
STAGE 02 · 浏览分组
所属 Stage · 建模与历史
为什么学 Grain 不确定时,JOIN 与聚合很容易重复计量:同一笔借据被还款记录放大成多行。
学完应能 判断一行数据代表哪件业务事实,并据此选择可安全聚合的粒度。
预计 22 分钟 · 2 节
本主题没有必需的前置主题。
所属 Stage · 建模与历史
为什么学 把交易、快照和生命周期事件混成一张事实表时,时间语义会互相污染,指标难以解释。
学完应能 区分不同事实表的时间语义,为业务过程选择合适的事实类型。
预计 28 分钟 · 2 节
判断事实表记录什么以及一行代表什么,必须先明确业务过程与 Grain。
所属 Stage · 建模与历史
为什么学 维度只保留当前值时,历史事实会被新的客户等级或机构归属改写,回溯分析得到错误结论。
学完应能 识别需要保留历史的维度变化,并判断何时使用拉链表。
预计 14 分钟 · 1 节
理解历史维度如何关联事实记录,需要先掌握事实、维度及其键关系。
STAGE 03 · 浏览分组
所属 Stage · 指标语义
为什么学 统计对象、范围和时间没有写清时,同一个「存款余额」会给出多个互相矛盾的答案。
学完应能 解释指标差异来自哪一项定义要素,而不是把口径分歧当成数据错误。
预计 20 分钟 · 2 节
定义指标统计对象和度量时,必须先知道业务过程及其记录粒度。
所属 Stage · 指标语义
为什么学 分不清时点值与期间累计时,日终余额会被误当成当日流量,派生指标随之整体错位。
学完应能 区分状态与事件的时间语义,并选择能支持派生指标的基础度量。
预计 22 分钟 · 2 节
区分时点与期间并组合派生指标,需要先明确指标的对象、度量和范围。
判断指标时间表达对应状态还是事件,必须先理解事实表的时间形态。
STAGE 04 · 浏览分组
所属 Stage · 数据加工与契约
为什么学 加工前不确认输出一行代表什么,去重和关联会在错误粒度上执行,错误被写进下游明细。
学完应能 判断加工输出的一行代表什么,再选择去重、关联和标准化的处理顺序。
预计 22 分钟 · 2 节
所属 Stage · 数据加工与契约
为什么学 一对多 JOIN 会复制度量,金额随关联行数放大,而且整个过程没有任何系统报错。
学完应能 判断 JOIN 前后粒度是否变化,并验证汇总结果没有被重复计数。
预计 22 分钟 · 2 节
分析 Join 是否复制或改变结果行,必须先能说明业务过程与输入 Grain。
解释加工后的明细与汇总如何分层产出,需要先理解加工计划和可信输入。
所属 Stage · 数据加工与契约
为什么学 输入、业务日期和重复执行预期没有约定时,重跑与补数会制造重复或缺失的写入。
学完应能 判断一段加工能否安全重跑,并写清输入、业务日期与重复执行预期。
预计 10 分钟 · 1 节
约定加工交接的输入、输出和重复执行预期,需要先明确加工结果及其粒度。
STAGE 05 · 浏览分组
所属 Stage · 调度与恢复
为什么学 把调度日期、自然日期和业务日期混为一谈时,任务会写错分区,或在输入未就绪时提前启动。
学完应能 区分三类日期,并判断一个任务应等待哪些输入才能开始。
预计 22 分钟 · 2 节
判断任务何时可运行以及写入哪个业务分区,需要先理解加工交接契约。
所属 Stage · 调度与恢复
为什么学 分不清 Retry、Rerun 与 Backfill 的语义时,补数可能重复写入,失败传播范围也难以判断。
学完应能 判断一次「再跑一次」应该用哪种恢复方式,以及会影响哪些下游任务。
预计 26 分钟 · 2 节
讨论失败后哪些任务等待以及如何重跑,需要先理解业务日期与运行就绪条件。
判断 Retry、Rerun 是否会造成重复写入,需要先理解输入输出和幂等预期。
所属 Stage · 调度与恢复
为什么学 只看任务成功不看业务可用时间时,上游延迟会一路传到报表,直到业务方发现数据没到。
学完应能 追踪延迟在加工链上的传递,判断数据是否满足业务可用时间。
预计 12 分钟 · 1 节
判断数据是否在业务可用时间前就绪,需要先区分业务日期与任务启动条件。
STAGE 06 · 浏览分组
所属 Stage · 质量与血缘
为什么学 把调度 SUCCESS 当成数据可信时,行级错误与关键字段异常会在发布环节前无人拦截。
学完应能 区分运行状态与质量状态,并为一张表确定值得检查的规则范围。
预计 20 分钟 · 2 节
制定记录身份和业务字段质量规则,需要先知道被检查数据代表什么业务过程。
区分加工完成与数据可信状态,需要先理解交接输入、输出和运行承诺。
解释质量判断所对应的数据批次和业务日期,需要先掌握日期与就绪语义。
该质量状态课程从 Scheduler SUCCESS / SLA MET 交接出发,理解它需要 SLA 与可用时间语义。
所属 Stage · 质量与血缘
为什么学 只检查单行时,应到数据缺失、口径漂移和整批不可信通常不会被发现。
学完应能 从整批完整性、Freshness 与对账判断一份数据是否可信,并组织可调查的证据。
预计 24 分钟 · 2 节
把单条规则扩展为整批判断和 Quality Event,需要先理解规则与运行状态。
判断整批数据是否完整且及时,需要先理解业务要求的可用时间。
跨层对账要判断金额差异是否来自粒度或 Join,必须先理解安全 Join 和分层产出。
整批跨层对账必须固定业务日期、币种、统计集合和客户 / 产品口径。
所属 Stage · 质量与血缘
为什么学 发现问题却没有发布决定时,不可信数据仍可能流向消费方,事后无法解释谁放行了它。
学完应能 判断质量问题应 BLOCK 还是 quarantine,并说明该决定的适用条件。
预计 10 分钟 · 1 节
决定发布、阻断或隔离时,需要先具备整批质量结论及其可调查证据。
所属 Stage · 质量与血缘
为什么学 只知道直接上游表时,字段重命名、过滤和 JOIN 造成的变化无法定位,排查会在错误方向耗时。
学完应能 追踪一份数据在表级与字段级上的来源,定位变化发生的加工位置。
预计 20 分钟 · 2 节
追踪表与字段在加工链中的来源,需要先理解 Join 和分层怎样改变数据。
理解上游来源、加工位置和消费去向,需要先掌握数据链路与层级职责。
所属 Stage · 质量与血缘
为什么学 质量告警后没有调查顺序时,排查会在无关上游往返,真正的根因候选被排到后面。
学完应能 从告警对象出发确定根因候选与受影响下游,并确定检查范围。
预计 22 分钟 · 2 节
按依赖关系定位根因或传播影响,必须先理解表级与字段级血缘关系。
从质量事件选择上游调查起点,需要先理解整批质量结论及其证据。
所属 Stage · 质量与血缘
为什么学 把一条未经验证的血缘箭头当作事实时,影响分析会建立在猜测之上。
学完应能 判断一条血缘关系由什么证据支持、当前是否可以直接使用。
预计 10 分钟 · 1 节
STAGE 07 · 浏览分组
所属 Stage · 治理与湖仓架构
为什么学 名称相似的多张资产容易被随手取用,业务定义或 Grain 不一致会让统计结果悄悄偏离。
学完应能 选择业务定义、Grain 与可用性证据匹配的资产,而不是凭表名猜测。
预计 20 分钟 · 2 节
所属 Stage · 治理与湖仓架构
为什么学 能查到字段不代表应该直接使用;权限与生命周期变化会让旧任务在不该继续后仍然运行。
学完应能 判断字段的最小必要访问方式,并识别旧资产的废弃与替代状态。
预计 22 分钟 · 2 节
判断已选资产中的字段能否使用以及旧资产何时退役,需要先识别资产及其用途。
所属 Stage · 治理与湖仓架构
为什么学 字段变更后只通知直接下游时,传递影响的资产与 Owner 会被遗漏,责任无人闭环。
学完应能 追踪一次字段变更的传递影响,并映射到需要处理的资产负责人。
预计 12 分钟 · 1 节
把字段变化传播到受影响资产与 Owner,需要先能分析血缘影响范围。
所属 Stage · 治理与湖仓架构
为什么学 把所有数据都放进仓、或全部留在湖,无法同时满足访问频率与查询 SLA,成本和延迟都会失控。
学完应能 判断哪些数据值得进入 Warehouse,哪些留在湖中即可满足消费。
预计 30 分钟 · 2 节
本主题没有必需的前置主题。
所属 Stage · 治理与湖仓架构
为什么学 只看文件而不理解表能力时,Schema Evolution、Snapshot 与 Time Travel 的正确性边界会被误判。
学完应能 解释文件上的表能力如何工作,并区分异构湖仓与共享元数据的责任边界。
预计 30 分钟 · 2 节
讨论表层事务能力和湖仓一体的边界,需要先理解存储体系及复制取舍。
STAGE 08 · 浏览分组
所属 Stage · 服务、性能与生产实践
为什么学 数据加工完成后没有明确交付契约时,消费方会自行解读口径与可用时间,责任边界变得模糊。
学完应能 区分人查看、批量接收与按需获取三类消费模式及其契约要求。
预计 10 分钟 · 1 节
定义可交付数据服务的发布边界,需要先理解质量结论如何决定能否发布。
所属 Stage · 服务、性能与生产实践
为什么学 不看消费者与数据量就选交付方式时,报表、文件与 API 的边界会被混用,触发方式也随之含糊。
学完应能 识别不同交付渠道的触发方式与可用性标志,判断一批数据何时真正可消费。
预计 34 分钟 · 3 节
本主题没有必需的前置主题。
所属 Stage · 服务、性能与生产实践
为什么学 交付方式只按个人偏好选择时,实时性、数据量和消费方系统反而无法被满足。
学完应能 选择与消费者、数据量和触发方式匹配的交付渠道。
预计 12 分钟 · 1 节
比较渠道并做选择,需要先理解 report、file、API 的消费边界。
所属 Stage · 服务、性能与生产实践
为什么学 任务变慢时凭印象调参,扫描阶段、分区裁剪和小文件问题会被掩盖,优化投入无法命中瓶颈。
学完应能 判断主要耗时来自哪个执行阶段,以及扫描布局是否是瓶颈原因。
预计 26 分钟 · 2 节
诊断扫描与加工性能时,需要先理解数据粒度和 Join / 分层可能造成的工作量。
所属 Stage · 服务、性能与生产实践
为什么学 分不清日期分区倾斜与 Shuffle 倾斜时,加分区或调并行度可能完全无效。
学完应能 区分两类倾斜,并判断用增量状态替代全量历史扫描是否成立。
预计 30 分钟 · 2 节
识别长尾倾斜和增量状态优化问题,需要先掌握基础性能诊断与扫描观察。
判断倾斜键或增量状态是否符合业务记录粒度,需要先理解业务过程与 Grain。
所属 Stage · 服务、性能与生产实践
为什么学 只对比跑得快时,正确性、幂等和迟到数据会被牺牲,优化反而制造新的数据问题。
学完应能 判断优化是否同时守住正确性、幂等与扫描成本,而不是只看跑得更快。
预计 16 分钟 · 1 节
评估优化后是否值得承担成本与复杂度,需要先理解具体性能问题和增量状态。
比较提速收益是否满足交付目标,需要先理解数据可用时间与 SLA。
所属 Stage · 服务、性能与生产实践
为什么学 只按单点知识完成任务时,调度、质量、血缘和服务的联合约束会在发布前夜集中暴露。
学完应能 综合加工、质量、血缘与交付约束完成一次跨系统发布判断。
预计 35 分钟 · 1 节
完成跨系统交付评审,需要先能说明加工输入、输出与重复执行承诺。
做 Launch Review 的发布判断,需要先掌握质量证据如何形成发布或阻断决定。
在综合交付中解释变更影响与调查范围,需要先理解血缘调查和影响分析。
完成数据产品交付方案,需要先能依据消费者选择合适的数据服务渠道。
综合评审交付性能、成本与维护风险,需要先理解工程优化取舍。
所属 Stage · 服务、性能与生产实践
为什么学 只凭「昨天成功了」或「任务 SUCCESS」判断问题时,生命周期路径差异与交付契约缺口都会在运行期才暴露。
学完应能 从运行证据与交付链证据定位数据停在生产、完成、传输、识别还是消费边界。
预计 36 分钟 · 2 节
分析生命周期故障中的目标对象和历史记录,需要先理解事实记录与时间形态。
定位次日路径为何缺少当前日期写入单元,需要先区分业务日期与对象存在状态。
复盘生产任务的失败路径与恢复动作,需要先理解失败传播、Retry 和 Rerun。