什么是数据中台？

数据分析自学者

01数据中台的前世今生

在正式进入数据中台建设实践之前，我想花点时间先聊一聊大数据的发展史，这样更能理解数据中台诞生的原因。不管是学习一项知识，还是讨论一个问题，最好的方法都不应该是一头扎进细节里，而是应该先从时空的维度了解其来龙去脉，当你了解了一件事物的前因后果后，更能透过现象，洞察背后的本质。理解了大数据的发展历史，更能体会数据中台诞生的必然性和数据中台建设方法论。

1.0 数据仓库诞生

1996年，美国加特纳集团第一次提出商业智能的概念，它是指通过一系列的技术和方法，将企业已有的数据转化为有用的信息，帮助企业制定经营分析决策。比如，对于零售企业的库存管理，如何保证不大面积断货影响产品销量的同时，避免库存大量积压导致的成本增加，我们要分析每个商品的销售量趋势、库存情况和未来销量预测，制定合理的采购计划，对滞销商品采取降价促销，对畅销品、爆品要提前下生产订单，供应链部门根据商品订单，提前采购、生产。这些需求的实现，依赖于聚合多个业务系统数据进行分析，如供应链系统、仓储系统等。同时也要保存历史数据，支持销量预测。然而，传统数仓是面向单一业务系统，主要实现面向事物的增删改查，不能满足复杂的数据分析场景，此时，数据仓库的概念应运而生了。

数据仓库之父比尔·恩门在 1991 年出版的《Building the Data Warehouse》中首次给出了数据仓库的完整定义：数据仓库是在企业管理和决策中面向主题的、集成的、与时间相关的，不可修改的数据集合。举个例子让大家更好的理解，比如在电商场景中，订单数据、会员数据、库存数据存放在三个不同的数据仓库中，构建数据仓库，首先要把不同业务系统的数据同步到一个统一的数据仓库中，然后按照划分主题域的方式组织数据。

主题域是对业务过程的高度抽象，像商品、交易、用户、供应链都能作为一个主题域，可以把它理解为数据仓库的一个目录。数据仓库中的数据一般是按照时间进行分区存放，一般会保留 5 年以上，每个时间分区内的数据都是追加写的方式，对于某条记录是不可更新的。

数据仓库的出现，明确了复杂场景的数据分析解决方案，让数据分析场景不再依赖业务数据库，也为商业智能的发展奠定了技术基础。

2.0 Hadoop出现

进入互联网时代后，有两个比较明显的变化，一个是数据规模的增长前所未有，一个是数据异构化普遍存在。传统数据库难于扩展、数据在导入前必须事先定义好模型的特性，决定了传统数据仓库根本无法承载互联网时代海量数据存储和计算。

2004年前后，当大多数公司还在研究如何扩展单机性能，寻找更贵更好的服务器时，互联网巨头谷歌发表的 3 篇论文让业界为之一振，也就是我们经常听到的“三驾马车”，分别是分布式文件系统 GFS、大数据分布式计算框架 MapReduce 和 NoSQL 数据库系统 BigTable。论文思路是部署一个大规模的服务器集群，通过分布式的方式将海量数据存储在这个集群上，然后利用集群上的所有机器进行数据计算。这样一来，Google 其实不需要买很多很贵的服务器，它只要把这些普通的机器组织到一起，就能实现大量的数据的存储和计算。

当时的天才程序员Doug Cutting 受Google 的论文影响，开始基于论文原理实现GFS和MapReduce的功能，两年后，Google

发布于 2021-08-12 16:44

商业智能（BI）

数据

数据分析

什么是数据中台？

文章被以下专栏收录

我的数据分析自学之路