1、Spark介绍1.1、Spark是什么Spark是什么定义:Apache Spark是用于大规模数据(large-scala data)处理的统一(unified)分析引擎。Spark最早源于一篇论文 Resilient Distributed Datasets: A Fault-Tolerant Abstraction f
1991年,比尔·恩门(Bill Inmon)出版了他的第一本关于数据仓库的书《Building the Data Warehouse》,标志着数据仓库概念的确立。我们所常说的企业数据仓库Enterprise Data Warehouse (EDW) ,就是一个用于聚合不同来源的数据(比如事务系统、关系数据库和操作数据库),然后方便进行数据访问、分析和报告的系统(例如销售交易数据、移动应用数据和C