最新公告
  • 欢迎您光临小鹏博客,本站秉承服务宗旨 履行“站长”责任,销售只是起点 服务永无止境!立即加入我们
  • 正文概述
  • 评价建议
  • 资源名称:Hadoop硬实战 

    内容简介:

    Hadoop 是一个开源的MapReduce 平台,设计运行在大型分布式集群环境中,为开发者进行数据存储、管理以及分析提供便利的方法。《Hadoop硬实战》详细讲解了Hadoop 和MapReduce 的基本概念,并收集了85 个问题及其解决方案。在关键问题领域对基础概念和实战方法做了权衡。

    《Hadoop硬实战》适合使用Hadoop 进行数据存储、管理和分析的技术人员使用。

    资源目录:

    前言 …………………………………………………………………………………………………XV

    致谢 ………………………………………………………………………………………………XVII

    关于本书 ……………………………………………………………………………………….. XIX

    第1 部分 背景和基本原理………………………………………..1

    1 跳跃中的Hadoop…………………………………………………………………………… 3

    1.1 什么是Hadoop ……………………………………………………………………………………. 4

    1.1.1 Hadoop 的核心组件 …………………………………………………………………. 5

    1.1.2 Hadoop 生态圈 ………………………………………………………………………… 9

    1.1.3 物理架构 ……………………………………………………………………………….. 10

    1.1.4 谁在使用Hadoop …………………………………………………………………… 12

    1.1.5 Hadoop 的局限性 …………………………………………………………………… 13

    1.2 运行Hadoop ……………………………………………………………………………………… 14

    1.2.1 下载并安装Hadoop ……………………………………………………………….. 14

    1.2.2 Hadoop 的配置 ………………………………………………………………………. 15

    1.2.3 CLI 基本命令 …………………………………………………………………………. 17

    1.2.4 运行MapReduce 作业 …………………………………………………………….. 18

    1.3 本章小结 ………………………………………………………………………………………….. 24

    第2 部分 数据逻辑………………………………………………. 25

    2 将数据导入导出Hadoop…………………………………………………27

    2.1 导入导出的关键要素 ………………………………………………………………………… 29

    2.2 将数据导入Hadoop …………………………………………………………………………… 30

    2.2.1 将日志文件导入Hadoop ………………………………………………………… 31

    技术点1 使用Flume 将系统日志文件导入HDFS ……………………….. 33

    2.2.2 导入导出半结构化和二进制文件 ……………………………………………. 42

    技术点2 自动复制文件到HDFS 的机制 …………………………………….. 43

    技术点3 使用Oozie 定期执行数据导入活动 ………………………………. 48

    2.2.3 从数据库中拉数据 …………………………………………………………………. 52

    技术点4 使用MapReduce 将数据导入数据库 …………………………….. 53

    技术点5 使用Sqoop 从MySQL 导入数据 ………………………………….. 58

    2.2.4 HBase ……………………………………………………………………………………. 68

    技术点6 HBase 导入HDFS ……………………………………………………….. 68

    技术点7 将HBase 作为MapReduce 的数据源 ……………………………. 70

    2.3 将数据导出Hadoop …………………………………………………………………………… 73

    2.3.1 将数据导入本地文件系统 ………………………………………………………. 73

    技术点8 自动复制HDFS 中的文件 ……………………………………………. 73

    2.3.2 数据库 …………………………………………………………………………………… 74

    技术点9 使用Sqoop 将数据导入MySQL …………………………………… 75

    2.3.3 Hbase …………………………………………………………………………………….. 78

    技术点10 将数据从HDFS 导入HBase ………………………………………. 78

    技术点11 使用HBase 作为MapReduce 的数据接收器 ……………….. 79

    2.4 本章小结 ………………………………………………………………………………………….. 81

    3 数据序列化——处理文本文件及其他格式的文件……………………83

    3.1 了解MapReduce 中的输入和输出 ……………………………………………………… 84

    3.1.1 数据输入 ……………………………………………………………………………….. 85

    3.1.2 数据输出 ……………………………………………………………………………….. 89

    3.2 处理常见的序列化格式 …………………………………………………………………….. 91

    3.2.1 XML ……………………………………………………………………………………… 91

    技术点12 MapReduce 和XML …………………………………………………… 91

    3.2.2 JSON ……………………………………………………………………………………… 95

    技术点13 MapReduce 和JSON ………………………………………………….. 95

    3.3 大数据的序列化格式 ………………………………………………………………………… 99

    3.3.1 比较SequenceFiles、Protocol Buffers、Thrift 和 Avro ……………… 99

    3.3.2 Sequence File ………………………………………………………………………… 101

    技术点14 处理SequenceFile …………………………………………………….. 103

    3.3.3 Protocol Buffers …………………………………………………………………….. 109

    技术点15 整合Protocol Buffers 和MapReduce …………………………. 110

    3.3.4 Thrift ……………………………………………………………………………………. 117

    技术点16 使用Thrift ……………………………………………………………….. 117

    3.3.5 Avro …………………………………………………………………………………….. 119

    技术点17 MapReduce 的下一代数据序列化技术 ………………………. 120

    3.4 自定义文件格式 ……………………………………………………………………………… 127

    3.4.1 输入输出格式 ………………………………………………………………………. 127

    技术点18 输入和输出格式为CSV 的文件 ……………………………….. 128

    3.4.2 output committing 的重要性 ………………………………………………….. 136

    3.5 本章小结 ………………………………………………………………………………………… 136

    第3 部分 大数据模式…………………………………………..137

    .

    .

    第4 部分 数据科学……………………………………………….251

    .

    第5 部分 驯服大象………………………………………………333

    .

    附录A 相关技术…………………………………………………………… 443

    附录B Hadoop 内置的数据导入导出工具……………………………. 471

    附录C HDFS 解剖……………………………………………………….. 486

    附录D 优化MapReduce 合并框架…………………………………….. 493

    索引……………………………………………………………………………… 503

    资源截图:

    1.png


    小鹏博客 » Hadoop硬实战

    常见问题FAQ

    免费下载或者VIP会员专享资源能否直接商用?
    本站所有资源版权均属于原作者所有,这里所提供资源均只能用于参考学习用,请勿直接商用。若由于商用引起版权纠纷,一切责任均由使用者承担。更多说明请参考 VIP介绍。
    提示下载完但解压或打开不了?
    最常见的情况是下载不完整: 可对比下载完压缩包的与网盘上的容量,若小于网盘提示的容量则是这个原因。这是浏览器下载的bug,建议用百度网盘软件或迅雷下载。若排除这种情况,可在对应资源底部留言,或 联络我们.。
    找不到素材资源介绍文章里的示例图片?
    对于PPT,KEY,Mockups,APP,网页模版等类型的素材,文章内用于介绍的图片通常并不包含在对应可供下载素材包内。这些相关商业图片需另外购买,且本站不负责(也没有办法)找到出处。 同样地一些字体文件也是这种情况,但部分素材会在素材包内有一份字体下载链接清单。

    发表评论

    售后服务:

    • 售后服务范围 1、商业模板使用范围内问题免费咨询
      2、源码安装、模板安装(一般 ¥50-300)服务答疑仅限SVIP用户
      3、单价超过200元的模板免费一次安装,需提供服务器信息。
      付费增值服务 1、提供dedecms模板、WordPress主题、discuz模板优化等服务请详询在线客服
      2、承接 WordPress、DedeCMS、Discuz 等系统建站、仿站、开发、定制等服务
      3、服务器环境配置(一般 ¥50-300)
      4、网站中毒处理(需额外付费,500元/次/质保三个月)
      售后服务时间 周一至周日(法定节假日除外) 9:00-23:00
      免责声明 本站所提供的模板(主题/插件)等资源仅供学习交流,若使用商业用途,请购买正版授权,否则产生的一切后果将由下载用户自行承担,有部分资源为网上收集或仿制而来,若模板侵犯了您的合法权益,请来信通知我们(Email: 80027422@qq.com),我们会及时删除,给您带来的不便,我们深表歉意!

    Hi, 如果你对这款模板有疑问,可以跟我联系哦!

    联系作者
    • 37会员总数(位)
    • 13499资源总数(个)
    • 0本周发布(个)
    • 0 今日发布(个)
    • 105稳定运行(天)

    小鹏博客XIAOPBK.COM一个高级程序员模板开发平台提供最优质的资源集合

    开通SVIP 客服QQ