新闻详情

新闻详情

首页 / 资讯中心 / 详情

读数据架构知识体系指南11数据建模方法(下)

发布时间:2026/10/1 10:10:06来源:尧图网络
读数据架构知识体系指南11数据建模方法(下)
1. Kimball模型1.1. 更适合数据需求较简单的组织1.2. Kimball的自底向上方法1.2.1. 都是先将原始数据从每个OLTP源系统提取到临时关系暂存表中不进行转换或清理1.2.2. 数据集市通过DW总线有时也称为信息总线进行整合以实现数据一致性1.2.3. 为了在数据源之间提供一致性数据集市使用一致维度进行集成这些维度是跨多个事实表标准化并保持一致的维度因此数据可以跨事实表使用和比较而不会产生任何问题1.2.4. 数据集市中的数据子集可以复制到立方体中1.2.5. Kimball的方法是业务驱动的最终用户是积极的参与者1.2.6. 数据只需复制两次*即复制到数据集市和立方体1.2.7. 如果使用维度化视图则只需复制一次1.3. Kimball方法跳过了规范化的数据仓库1.4. Kimball方法使用符合标准的EDW但没有物理EDW1.5. Kimball在数据仓库总线中将数据湖与数据集市并列1.6. 可以在基于Kimball的方法中添加规范化EDW1.7. Kimball方法实际上包含了自顶向下和自底向上两种方法1.7.1. 自顶向下的方法体现在整个企业的战略规划和设计中1.7.2. Kimball强调在前期花费大量时间设计解决方案使用一种称为EDW总线矩阵的工具1.8. 该工具是企业核心业务流程及其相关维度包括一致维度的架构蓝图1.9. EDW总线矩阵提供了自顶向下的战略视角以确保DW/BI环境中的数据可以在整个企业内部集成1.10. Kimball并没有发明事实和维度的基本概念他建立了一个广泛的维度技术和词汇表包括一致维度、缓慢变化维度、垃圾维度、小维度、桥接表以及周期性和累积快照事实表2. Inmon模型2.1. Bill Inmon被称为“数据仓库之父”​2.2. Inmon的自顶向下方法2.2.1. 强调整合多种来源的数据并以有助于决策的方式呈现出来2.2.2. 自顶向下的方法是一种传统、严谨、定义明确的方法通常是大型复杂组织的首选2.2.3. 在拥有大量数据并重视治理、数据质量和合规性的大型复杂组织中这种方法通常更受青睐2.2.4. 主要由技术部门驱动最终用户被动参与2.2.5. 首先要确定最终用户的业务需求2.2.6. CIF专注于数据建模和设计重点强调治理和数据质量2.2.7. 数据集市之所以称为“依赖型”​是因为它依赖CIF中的数据而不从其他任何地方获取数据2.2.8. 用户不能访问CIF只能通过数据集市或立方体访问数据2.2.9. 意味着数据会被永久复制在CIF、数据集市和立方体中复制三次2.3. Inmon方法在创建数据集市之前创建了一个规范化的数据仓库2.4. Inmon方法使用物理EDW2.5. Inmon和Kimball都允许数据湖取代关系型暂存表2.6. 在基于Inmon的方法中添加维度结构化数据集市2.7. Inmon从一开始就指出建立数据仓库的方法是迭代式的2.8. 建立数据仓库最关键的成功因素就是不使用大爆炸方法2.9. 建立第一个分析能力数据集市之前并不建议建立一个包含所有企业战略数据的完整数据仓库2.9.1. 通过实施另一个数据集市来解决的每一个后续业务项目都将为作为数据仓库基础的不断增长的数据集增加一些东西2.9.2. 为支持新的数据集市而必须添加到数据仓库中的数据量将微不足道因为大部分数据已经存在于数据仓库中2.10. Inmon认为星型模式数据集市有利于终端用户直接访问数据而星型模式则有利于数据集市2.10.1. 他并不反对它们2.11. 使用Inmon方法的公司比使用Kimball方法的还多2.11.1. 更多的公司在没有任何数据集市的情况下使用EDW3. 实体EDW3.1. 物理企业数据仓库使得拥有单一的真实版本变得更加容易由多个数据集市组成符合标准的数据仓库可能会给用户带来困难和混淆3.1.1. 将数据实际存储在同一个数据库中更容易理解3.2. 从物理企业数据仓库中轻度去规范化的表构建比直接从OLTP源构建更容易3.3. 规范化的物理EDW可提供企业范围内的一致性3.3.1. 这使数据集市的创建变得更加容易但同时也会带来数据重复的问题3.4. 物理EDW需要较少的ETL刷新和核对3.4.1. 如果多个数据库中有许多数据源和维度数据集市则需要更多的每日或每小时刷新和核对以保持所有数据同步3.5. 在物理EDW中只有一个地方可以控制数据因此不会重复工作或数据4. 混合模型4.1. 该模式一开始与其他两种模式类似将原始数据从每个OLTP源系统直接提取到临时关系暂存表中4.2. 对数据进行转换或清理但会添加一个镜像OLTP4.3. 立方体的优势4.3.1. 是一个语义层4.3.2. 可以处理许多并发用户4.3.3. 数据经过聚合性能更佳4.3.4. 无须处理连接或关系4.3.5. 可以包含层次结构和关键绩效指标4.3.6. 具有行级安全性可通过限制用户访问数据库中的特定行来提高数据的私密性5. 数据库视图5.1. 无论使用的是Kimball、Inmon还是混合模型都可以考虑使用数据库视图5.2. 数据库视图是基于SQL SELECT语句结果的虚拟表5.3. 不存储数据只存储SQL代码每次查询时从一个或多个表中检索数据5.4. 在提取、转换和加载(ETL)过程中使用视图可以简化ETL内部的代码而且不必查看视图中的SQL代码就能理解它在读取什么5.5. 通过视图可以更方便地查询数据库以进行调试而且可以通过在ETL代码之外更新视图来优化ETL5.6. 任何人都可以读取、修改或优化视图不仅在ETL工具中可以在其他工具中也可以还可以使用第三方工具如视图使用的表和字段分析和跟踪视图中的依赖关系5.7. 视图可以提供默认值并执行简单的计算还可以重命名字段以帮助理解其流程5.8. 视图可以呈现星形模式即使底层结构要复杂得多5.9. 可以在立方体中使用视图5.9.1. 如果使用视图就可以重命名数据库列使其与立方体属性保持一致这样做的好处是可以向数据库管理员公开所有转换5.9.2. 用视图可以简化对快速变化的处理并允许完全控制向立方体提取的源发送的任何连接5.9.3. 就像在ETL中一样即使底层结构不是简单的星形模式立方体中的视图也能显示星形模式6. OLTP镜像6.1. 创建OLTP镜像是一种很好的策略6.2. 意味着只在镜像期间短暂使用“真正的”OLTP6.3. 后镜像就会被释放出来供最终用户或维护人员使用6.4. 意味着不需要对原始OLTP进行索引维护6.5. 可以提高ETL流程其他步骤的性能6.6. 由于可以镜像列的子集因此无须加载所有OLTP表。这使得镜像比完整的OLTP更小更快
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

KVM虚拟化全解析:内核原理、VMware对比与OpenStack底层实践 2026/10/1 10:59:09

KVM虚拟化全解析:内核原理、VMware对比与OpenStack底层实践

KVM 这个项目名最近在技术圈里热度一直没降过。无论是 OpenStack 这种大型云平台,还是面对 VMware 日益收紧的授权模式,大家都在一遍遍提到 KVM。很多人问“KVM 和 VMware 到底选哪个”,也有人在追问“OpenStack 底层为什么偏偏是 KVM”。这篇…

阅读更多 →
微信个人号API对接实战:HTTP接口调用与稳定架构 2026/10/1 10:59:09

微信个人号API对接实战:HTTP接口调用与稳定架构

写微信个人号API对接这话题,得先泼一盆冷水:目前微信官方没有任何直接面向个人号的API,你们四处打听到的“API接口”“对接方案”,一般只有两条路——要么是企业微信开放平台的能力封装,要么是第三方合规服务商把个人号…

阅读更多 →
Win11 21H2最终版22000.3260:安装、优化与常见问题全解析 2026/10/1 10:59:09

Win11 21H2最终版22000.3260:安装、优化与常见问题全解析

1. Win11 21H2 最终版:为什么这个版本值得关注先说结论:Win11 21H2 的最终累积更新版本号是22000.3260,这大概率是 21H2 分支的“谢幕之作”。如果你还在用 Win10 但想体验 Win11 的界面,又受不了新版本的各种“花活”&#xff0c…

阅读更多 →
AI辅助学术论文写作:从查重焦虑到合规高效的工作流 2026/10/1 10:59:09

AI辅助学术论文写作:从查重焦虑到合规高效的工作流

又是一年毕业季,论坛和群里铺天盖地的提问从“实验怎么做”变成了“论文怎么降重”“AI写的能不能用”“学校查重会不会标AI”。说实话,我做了这么多年的学术写作辅助工具研究,看着周围的学生和年轻研究者被格式、查重、文献综述搞得焦头烂额…

阅读更多 →
深入浅出AWS Lambda:从入门到生产落地的Serverless实战指南 2026/10/1 10:59:02

深入浅出AWS Lambda:从入门到生产落地的Serverless实战指南

拿到这个主题的时候,我第一反应是:Serverless 这个概念被“吹”了这么多年,从最早的“连服务器都不需要管”到后来被无数人吐槽“比自建服务器还烧钱”,中间实在有太多误解。AWS Lambda 作为这个赛道的鼻祖和事实标准,…

阅读更多 →
AI辅助论文写作全流程指南:从选题到降重,合规又高效 2026/10/1 10:59:02

AI辅助论文写作全流程指南:从选题到降重,合规又高效

论文季一到,小组群里就热闹了:“开题还没思路怎么办?”“文献读不完,怎么提炼观点?”“初稿憋了一周,还是几百字……”这几年我亲眼看着学弟学妹们从查资料查到崩溃,到后来用AI工具把重复劳动甩…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉