大数据Spark企业级实战(决胜大数据时代Spark全系列书籍)王家林电子工业出版社豆瓣PDF电子书bt网盘迅雷下载-霍普软件下载网

第1章 Spark编程模型

1.1 Spark：一体化、多元化的高速大数据通用计算平台和库

1.1.1 为什么需要使用Spark

1.1.2 Spark技术生态系统简介

1.2 Spark大数据处理框架

1.2.1 Spark速度为何如此之快

1.2.2 RDD：分布式函数式编程

1.3 Spark子框架解析

1.3.1 图计算框架Spark GraphX

1.3.2 实时流处理框架（Spark Streaming）

1.3.3 交互式SQL处理框架Spark SQL

1.3.4 机器学习框架（Spark MLlib）

第2章构建Spark分布式集群

2.1 搭建Hadoop单机版本和伪分布式开发环境

2.1.1 开发Hadoop需要的基本软件

2.1.2 安装每个软件

2.1.3 配置Hadoop单机模式并运行Wordcount示例

2.1.4 配置Hadoop伪分布模式并运行Wordcount示例

2.2 搭建 Hadoop分布式集群

2.2.1 在VMWare 中准备第二、第三台运行Ubuntu系统的机器

2.2.2 按照配置伪分布式模式的方式配置新创建运行Ubuntu系统的机器

2.2.3 配置Hadoop分布式集群环境

2.2.4 测试Hadoop分布式集群环境

2.3 Spark集群的动手搭建

2.3.1 Spark集群需要的软件

2.3.2 安装每个软件

2.3.3 启动并查看集群的状况

2.4 构建Hadoop单机版本和伪分布式环境

2.4.1 通过Spark的shell测试Spark的工作

2.4.2 使用Spark的cache机制观察一下效率的提升

第3章 Spark开发环境及其测试

3.1 搭建和设置IDEA开发环境

3.1.1 构建Spark的IDE开发环境

3.1.2 配置Spark的IDE开发环境

3.2 测试IDEA环境

3.3 实战：在IDEA中开发代码，并运行在Spark集群中

第4章 Spark RDD与编程API实战

4.1 深度解析Spark RDD

4.2 Transformation Operations动手实战

4.3 Action Operations动手实战

4.4 Spark API综合实战

第5章 Spark运行模式深入解析

5.1 Spark运行模式概述

5.1.1 Spark的运行模式列表

5.1.2 Spark的基本工作流程

5.2 Standalone模式

5.2.1 部署及程序运行

5.2.2 内部实现原理

5.3 Yarn-Cluster模式

5.3.1 部署及程序运行

5.3.2 内部实现原理

5.4 Yarn-Client模式

5.4.1 部署及运行程序

5.4.2 内部实现原理

第6章 Spark内核解析

6.1 Spark内核初探

6.1.1 Spark内核核心术语解析

6.1.2 Spark集群概览

6.1.3 Spark核心组件

6.1.4 Spark任务调度系统初见

6.2 Spark内核核心源码解读

6.2.1 SparkContext核心源码解析初体验

6.2.2 TaskSceduler启动源码解析初体验

6.2.3 DAGScheduler源码解读初体验

6.2.4 Spark的Web监控页面

6.3 以RDD的count操作为例触发Job全生命周期源码研究

6.4 Akka驱动下的Driver、Master、Worker

6.4.1 Driver中的AppClient源码解析

6.4.2 AppClient注册Master

6.4.3 Worker中Executor启动过程源代码解析

第7章 GraphX大规模图计算与图挖掘实战

7.1 Spark GraphX概览

7.2 Spark GraphX设计实现的核心原理

7.3 Table operator和Graph Operator

7.4 Vertices、edges、triplets

7.5 以最原始的方式构建graph

7.6 动手编写第一个Graph代码实例并进行Vertices、edges、triplets操作

7.7 在Spark集群上使用文件中的数据加载成为graph并进行操作

7.8 在Spark集群上掌握比较重要的图操作

7.9 Spark GraphX图算法

7.10 淘宝对Spark GraphX的大规模使用

第8章 Spark SQL原理与实战

8.1 为什么使用Spark SQL

8.1.1 Spark SQL的发展历程

8.1.2 Spark SQL的性能

8.2 Spark SQL运行架构

8.2.1 Tree和Rule

8.2.2 sqlContext的运行过程

8.2.3 hiveContext的运行过程

8.2.4 catalyst优化器

8.3 解析Spark SQL组件

8.3.1 LogicalPlan

8.3.2 SqlParser

8.3.3 Analyzer

8.3.4 Optimizer

8.4 深入了解Spark SQL运行的计划

8.4.1 hive/console的安装过程和原理

8.4.2 常用操作

8.4.3 不同数据源的运行计划

8.4.4 不同查询的运行计划

8.4.5 查询的优化

8.5 搭建测试环境

8.5.1 搭建虚拟集群（Hadoop1、Hadoop2、Hadoop3）

8.5.2 搭建客户端

8.5.3 文件数据的准备工作

8.5.4 Hive数据的准备工作

8.6 Spark SQL之基础应用

8.6.1 sqlContext的基础应用

8.6.2 hiveContext的基础应用

8.6.3 混合使用

8.6.4 缓存的使用

8.6.5 DSL的使用

8.7 ThriftServer和CLI

8.7.1 令人惊讶的CLI

8.7.2 ThriftServer

8.8 Spark SQL之综合应用

8.8.1 店铺分类

8.8.2 PageRank

8.9 Spark SQL之调优

8.9.1 并行性

8.9.2 高效的数据格式

8.9.3 内存的使用

8.9.4 合适的Task

8.9.5 其他的一些建议

第9章 Machine Learning on Spark

9.1 Spark MLlib机器学习

9.1.1 机器学习快速入门

9.1.2 Spark MLlib介绍

9.1.3 Spark MLlib架构解析

9.1.4 Spark Mllib核心解析

9.2 MLlib经典算法解析和案例实战

9.2.1 Linear Regression解析和实战

9.2.2 K-Means解析和实战

9.2.3 协同过滤算法分析和案例实战

9.3 MLLib其他常用算法解析和代码实战

9.3.1 Basic Statics解析和实战

9.3.2 MLlib朴素贝叶斯解析和实战

9.3.3 MLlib决策树解析和实战

第10章 Tachyon文件系统

10.1 Tachyon文件系统概述

10.1.1 Tachyon文件系统简介

10.1.2 HDFS与Tachyon

10.1.3 Tachyon设计原理

10.2 Tachyon入门

10.2.1 Tachyon部署

10.2.2 Tachyon API的使用

10.2.3 在MapReduce、Spark上使用Tachyon

10.3 Tachyon深度解析

10.3.1 Tachyon整体设计概述

10.3.2 Tachyon Master启动流程分析

10.3.3 Tachyon Worker启动流程分析

10.3.4 客户端读写文件源码分析

10.4 Tachyon配置参数一览

10.5 小结

第11章 Spark Streaming原理与实战

11.1 Spark Streaming原理

11.1.1 原理和运行场景

11.1.2 编程模型DStream

11.1.3 持久化、容错和优化

11.2 Spark Streaming实战

11.2.1 源码解析

11.2.2 Spark Streaming实战案例

第12章 Spark多语言编程

12.1 Spark多语言编程的特点

12.2 Spark编程模型

12.3 深入Spark多语言编程

12.4 Spark多语言编程综合实例

第13章 R语言的分布式编程之SparkR

13.1 R语言快速入门

13.1.1 R语言是什么

13.1.2 R语言的特点

13.1.3 R语言的安装

13.1.4 R的核心概念

13.1.5 R动手实战

13.2 使用SparkR

13.2.1 SparkR的安装

13.2.2 使用SparkR编写WordCount

13.2.3 使用SparkR的更多代码示例

第14章 Spark性能调优和最佳实践

14.1 Spark性能调优

14.1.1 Spark性能优化的12大问题及其解决方法

14.1.2 Spark内存优化

14.1.3 RDD分区

14.1.4 Spark性能优化实例

14.2 Spark性能调优细节

14.2.1 broadcast和accumulator

14.2.2 reduce 和 reduceByKey

14.2.3 深入reduceByKey

第15章 Spark源码解析

15.1 BlockManager源码解析

15.2 Cache源码解析

15.3 Checkpoint源码解析

附录A 动手实战Scala三部曲

第一部动手体验Scala

第二部动手实战Scala面向对象编程

第三部动手实战Scala函数式编程

书名	大数据Spark企业级实战(决胜大数据时代Spark全系列书籍)
分类
作者	王家林
出版社	电子工业出版社
下载
简介	编辑推荐 Life is short， you need Spark！ Spark是当今大数据领域最活跃最热门的高效的大数据通用计算平台。基于RDD，Spark成功地构建起了一体化、多元化的大数据处理体系。王家林编著的《大数据Spark企业级实战》完全从企业处理大数据业务场景的角度出发，完全基于实战代码来组织内容，从零起步，不许任何基础，完全无痛地掌握Spark大数据处理实战技术，源码解析：内容推荐 Spark是当今大数据领域最活跃、最热门、最高效的大数据通用计算平台，是Apache软件基金会下所有开源项目中三大顶级开源项目之一。在“One Stack to rule them all”理念的指引下，Spark基于RDD成功地构建起了大数据处理的一体化解决方案，将MapReduce、Streaming、SQL、Machine Learning、Graph Processing等大数据计算模型统一到一个技术堆栈中，开发者使用一致的API操作Spark中的所有功能；更为重要的是Spark的Spark SQL、MLLib、GraphX、Spark Streaming等四大子框架之间可以在内存中完美的无缝集成并可以互相操作彼此的数据，这不仅打造了Spark在当今大数据计算领域其他任何计算框架都无可匹敌的优势，更使得Spark正在加速成为大数据处理中心首选的和唯一的计算平台。王家林编著的《大数据Spark企业级实战》详细解析了企业级Spark开发所需的几乎所有技术内容，涵盖Spark的架构设计、Spark的集群搭建、Spark内核的解析、Spark SQL、MLLib、GraphX、Spark Streaming、Tachyon、SparkR、Spark多语言编程、Spark常见问题及调优等，并且结合Spark源码细致的解析了Spark内核和四大子框架，最后在附录中提供了的Spark的开发语言Scala快速入门实战内容，学习完此书即可胜任绝大多数的企业级Spark开发需要。《大数据Spark企业级实战》从零起步，完全从企业处理大数据业务场景的角度出发，基于实战代码来组织内容，对于一名大数据爱好者来说，《大数据Spark企业级实战》内容可以帮助您一站式地完成从零起步到进行Spark企业级开发所需要的全部核心内容和实战需要。目录第1章 Spark编程模型 1.1 Spark：一体化、多元化的高速大数据通用计算平台和库 1.1.1 为什么需要使用Spark 1.1.2 Spark技术生态系统简介 1.2 Spark大数据处理框架 1.2.1 Spark速度为何如此之快 1.2.2 RDD：分布式函数式编程 1.3 Spark子框架解析 1.3.1 图计算框架Spark GraphX 1.3.2 实时流处理框架（Spark Streaming） 1.3.3 交互式SQL处理框架Spark SQL 1.3.4 机器学习框架（Spark MLlib）第2章构建Spark分布式集群 2.1 搭建Hadoop单机版本和伪分布式开发环境 2.1.1 开发Hadoop需要的基本软件 2.1.2 安装每个软件 2.1.3 配置Hadoop单机模式并运行Wordcount示例 2.1.4 配置Hadoop伪分布模式并运行Wordcount示例 2.2 搭建 Hadoop分布式集群 2.2.1 在VMWare 中准备第二、第三台运行Ubuntu系统的机器 2.2.2 按照配置伪分布式模式的方式配置新创建运行Ubuntu系统的机器 2.2.3 配置Hadoop分布式集群环境 2.2.4 测试Hadoop分布式集群环境 2.3 Spark集群的动手搭建 2.3.1 Spark集群需要的软件 2.3.2 安装每个软件 2.3.3 启动并查看集群的状况 2.4 构建Hadoop单机版本和伪分布式环境 2.4.1 通过Spark的shell测试Spark的工作 2.4.2 使用Spark的cache机制观察一下效率的提升第3章 Spark开发环境及其测试 3.1 搭建和设置IDEA开发环境 3.1.1 构建Spark的IDE开发环境 3.1.2 配置Spark的IDE开发环境 3.2 测试IDEA环境 3.3 实战：在IDEA中开发代码，并运行在Spark集群中第4章 Spark RDD与编程API实战 4.1 深度解析Spark RDD 4.2 Transformation Operations动手实战 4.3 Action Operations动手实战 4.4 Spark API综合实战第5章 Spark运行模式深入解析 5.1 Spark运行模式概述 5.1.1 Spark的运行模式列表 5.1.2 Spark的基本工作流程 5.2 Standalone模式 5.2.1 部署及程序运行 5.2.2 内部实现原理 5.3 Yarn-Cluster模式 5.3.1 部署及程序运行 5.3.2 内部实现原理 5.4 Yarn-Client模式 5.4.1 部署及运行程序 5.4.2 内部实现原理第6章 Spark内核解析 6.1 Spark内核初探 6.1.1 Spark内核核心术语解析 6.1.2 Spark集群概览 6.1.3 Spark核心组件 6.1.4 Spark任务调度系统初见 6.2 Spark内核核心源码解读 6.2.1 SparkContext核心源码解析初体验 6.2.2 TaskSceduler启动源码解析初体验 6.2.3 DAGScheduler源码解读初体验 6.2.4 Spark的Web监控页面 6.3 以RDD的count操作为例触发Job全生命周期源码研究 6.4 Akka驱动下的Driver、Master、Worker 6.4.1 Driver中的AppClient源码解析 6.4.2 AppClient注册Master 6.4.3 Worker中Executor启动过程源代码解析第7章 GraphX大规模图计算与图挖掘实战 7.1 Spark GraphX概览 7.2 Spark GraphX设计实现的核心原理 7.3 Table operator和Graph Operator 7.4 Vertices、edges、triplets 7.5 以最原始的方式构建graph 7.6 动手编写第一个Graph代码实例并进行Vertices、edges、triplets操作 7.7 在Spark集群上使用文件中的数据加载成为graph并进行操作 7.8 在Spark集群上掌握比较重要的图操作 7.9 Spark GraphX图算法 7.10 淘宝对Spark GraphX的大规模使用第8章 Spark SQL原理与实战 8.1 为什么使用Spark SQL 8.1.1 Spark SQL的发展历程 8.1.2 Spark SQL的性能 8.2 Spark SQL运行架构 8.2.1 Tree和Rule 8.2.2 sqlContext的运行过程 8.2.3 hiveContext的运行过程 8.2.4 catalyst优化器 8.3 解析Spark SQL组件 8.3.1 LogicalPlan 8.3.2 SqlParser 8.3.3 Analyzer 8.3.4 Optimizer 8.4 深入了解Spark SQL运行的计划 8.4.1 hive/console的安装过程和原理 8.4.2 常用操作 8.4.3 不同数据源的运行计划 8.4.4 不同查询的运行计划 8.4.5 查询的优化 8.5 搭建测试环境 8.5.1 搭建虚拟集群（Hadoop1、Hadoop2、Hadoop3） 8.5.2 搭建客户端 8.5.3 文件数据的准备工作 8.5.4 Hive数据的准备工作 8.6 Spark SQL之基础应用 8.6.1 sqlContext的基础应用 8.6.2 hiveContext的基础应用 8.6.3 混合使用 8.6.4 缓存的使用 8.6.5 DSL的使用 8.7 ThriftServer和CLI 8.7.1 令人惊讶的CLI 8.7.2 ThriftServer 8.8 Spark SQL之综合应用 8.8.1 店铺分类 8.8.2 PageRank 8.9 Spark SQL之调优 8.9.1 并行性 8.9.2 高效的数据格式 8.9.3 内存的使用 8.9.4 合适的Task 8.9.5 其他的一些建议第9章 Machine Learning on Spark 9.1 Spark MLlib机器学习 9.1.1 机器学习快速入门 9.1.2 Spark MLlib介绍 9.1.3 Spark MLlib架构解析 9.1.4 Spark Mllib核心解析 9.2 MLlib经典算法解析和案例实战 9.2.1 Linear Regression解析和实战 9.2.2 K-Means解析和实战 9.2.3 协同过滤算法分析和案例实战 9.3 MLLib其他常用算法解析和代码实战 9.3.1 Basic Statics解析和实战 9.3.2 MLlib朴素贝叶斯解析和实战 9.3.3 MLlib决策树解析和实战第10章 Tachyon文件系统 10.1 Tachyon文件系统概述 10.1.1 Tachyon文件系统简介 10.1.2 HDFS与Tachyon 10.1.3 Tachyon设计原理 10.2 Tachyon入门 10.2.1 Tachyon部署 10.2.2 Tachyon API的使用 10.2.3 在MapReduce、Spark上使用Tachyon 10.3 Tachyon深度解析 10.3.1 Tachyon整体设计概述 10.3.2 Tachyon Master启动流程分析 10.3.3 Tachyon Worker启动流程分析 10.3.4 客户端读写文件源码分析 10.4 Tachyon配置参数一览 10.5 小结第11章 Spark Streaming原理与实战 11.1 Spark Streaming原理 11.1.1 原理和运行场景 11.1.2 编程模型DStream 11.1.3 持久化、容错和优化 11.2 Spark Streaming实战 11.2.1 源码解析 11.2.2 Spark Streaming实战案例第12章 Spark多语言编程 12.1 Spark多语言编程的特点 12.2 Spark编程模型 12.3 深入Spark多语言编程 12.4 Spark多语言编程综合实例第13章 R语言的分布式编程之SparkR 13.1 R语言快速入门 13.1.1 R语言是什么 13.1.2 R语言的特点 13.1.3 R语言的安装 13.1.4 R的核心概念 13.1.5 R动手实战 13.2 使用SparkR 13.2.1 SparkR的安装 13.2.2 使用SparkR编写WordCount 13.2.3 使用SparkR的更多代码示例第14章 Spark性能调优和最佳实践 14.1 Spark性能调优 14.1.1 Spark性能优化的12大问题及其解决方法 14.1.2 Spark内存优化 14.1.3 RDD分区 14.1.4 Spark性能优化实例 14.2 Spark性能调优细节 14.2.1 broadcast和accumulator 14.2.2 reduce 和 reduceByKey 14.2.3 深入reduceByKey 第15章 Spark源码解析 15.1 BlockManager源码解析 15.2 Cache源码解析 15.3 Checkpoint源码解析附录A 动手实战Scala三部曲第一部动手体验Scala 第二部动手实战Scala面向对象编程第三部动手实战Scala函数式编程
随便看	英文字母(彩色升级版)/幼小衔接铅笔描红给水排水管网工程(第2版普通高等教育规划教材) 基于CiteSpace的社会科学文献计量研究智慧蓝领健康指南化工制图习题集(第2版高职高专规划教材) 工程制图习题集(第7版教育部高职高专规划教材) 国学启蒙故事/365夜有声故事会医院导视标识建设指南南大戏剧论丛(17 1) 信息系统分析与开发技术(第2版高等学校信息管理与信息系统专业系列教材)/信息化与信息社会系列丛书煤制甲醇全流程生产虚拟仿真现代设计方法(十四五普通高等教育本科系列教材) 心理委员工作蓝皮书--两百心理疗法与全国心理委员工作展示(2020) 广东省高等职业教育质量年度报告(2021) 无机化学(化工类第2版应用型本科院校十三五规划教材) 小朋友的书(托班上共5册)/幼儿园课程指导漫画说合规战疫纪事(下上海援鄂医疗队抗击新冠肺炎随笔集) 音乐(6上五线谱)/义教教科书哈农钢琴练指法/跟我弹钢琴系列教学版国家电网有限公司培训教育工作统计分析报告(2020年) 语文同步练习(7上R) 天津经济调研(2019)/天津市经济发展研究院智库报告古冢里的黄金铠甲/图图兔与兔突突数学闯关故事漫画书物理化学实验(第2版高等学校规划教材) 嗨星QQ空间说说评论群发软件 v6.8 GSA Image Spider v3.37 嗨星QQ加好友检测软件 v2.7 力灵拼多多群发软件 v1.5 嗨星QQ资料批量查询器 v2.7 爱编程少儿浏览器 v1.0 All My Books v5.0 Build 1251 wodSFTP v3.8.8 GoGoMail v9.0.1.0 QQ浏览器 v10.5.3805.400 测试版血战上海滩单机游戏英雄无敌3死亡阴影超级情圣战锤末世鼠疫猎杀对决通过BMX街道管幻想三国志5 天国拯救模拟人生4丛林探险猎人的喜悦 pronunciation proof proof positive proofread proofreader prop propaganda propagandist propagate propagator [BT下载][看不见影子的少年][第11集][WEB-MKV/0.65G][国语配音/中文字幕][1080P][流媒体][BlackTV] 剧集 2024 大陆剧情连载 [BT下载][看不见影子的少年][第11集][WEB-MKV/1.45G][国语配音/中文字幕][4K-2160P][H265][流媒体][BlackTV] 剧集 2024 大陆剧情连载 [BT下载][玫瑰的故事][第10-11集][WEB-MKV/5.03G][国语配音/中文字幕][4K-2160P][杜比视界版本][H265][流媒体][Co 剧集 2024 大陆剧情连载 [BT下载][玫瑰的故事][第10-11集][WEB-MKV/3.18G][国语配音/中文字幕][4K-2160P][H265][流媒体][ColorWEB] 剧集 2024 大陆剧情连载 [BT下载][我们家][第05-08集][WEB-MP4/3.47G][中文字幕][1080P][流媒体][BlackTV] 剧集 2024 韩国剧情连载 [BT下载][我们家][第05-06集][WEB-MKV/1.64G][简繁英字幕][1080P][流媒体][BlackTV] 剧集 2024 韩国剧情连载 [BT下载][斯特林韵事][第03集][WEB-MKV/5.64G][中文字幕][4K-2160P][杜比视界版本][H265][Disney+][流媒体][B 剧集 2024 美国剧情连载 [BT下载][斯特林韵事][第03集][WEB-MKV/5.30G][中文字幕][4K-2160P][H265][Disney+][流媒体][BlackTV] 剧集 2024 美国剧情连载 [BT下载][追分成功][第145集][WEB-MP4/5.64G][国语配音/中文字幕][1080P][流媒体][BlackTV] 剧集 2023 台湾剧情连载 [BT下载][狼与香辛料VR][第11集][WEB-MKV/1.35G][简繁英字幕][1080P][流媒体][ZeroTV] 剧集 2019 日本动画连载中戏表演全国第三？这就是“学霸”？粉丝在吹什么？老干妈被拉下“神坛”，李子柒辣椒酱又引争议，这是谁火谁就倒？白鹿帅气男装，论女扮男装，谁最惊艳，最后一位让你大开眼界他因长相太“坏”，做群演时被周星驰发掘，如今在横店买房买车！又一老演员去世，曾出演《喜盈门》《高山下的花环》 6位被当路人的明星！润娥素颜被无视、李英爱被女儿忽略且试天下：赵露思可以演白风夕，但她演不出风华绝代，倾国倾城！ 87岁资深影后王玉梅病逝！「演戏60年」患阿兹海默症，网友悼念《亡命救护车》评价一般：迈克尔·贝的无脑爽片酸菜熟肉馅饺子怎么调馅好吃