新手入门大数据 Hadoop基础与电商行为日志分析（二）

内容简介：HDFS:文件，块，副本假如：一个文件test.log,大小为200M,

HDFS:

文件，块，副本

假如：一个文件test.log,大小为200M,

一块（block），默认的blocksize是128M, 两个块=一个128M + 一个72M
  副本：HDFS默认3副本
 
  三个机器:node1:blk1 blk2 即使第一台机器挂掉了，也不影响
          node2:blk1
          node3:blk2
          node4:blk1 blk2

MapReduce:一个经典的wordcount的问题

文件内容：bear，apple,this,

some,you,love,apple,
     love,bear,this

先是split,分成一行一行的，然后map,每行的单个内容分开,{bear,1},{apple,1}{this,1}然后shuffle，{bear，[1,1]},{apple,[1,1]},{this,[1,1]},最后reduce得到最终结果{bear,2},{apple,2},{this,2}

YARN 资源调度器， Yet Another Resource Negotiator

负责整个集群的资源管理和调度

常用的hadoop发行版及选择：

Apache

优点：纯开源

缺点：不同版本/不同框架之间会有jar包冲突

CDH

优点：cm(cloudera manager)通过页面一键安装各种框架升级

缺点：cm不开源

Hortonworks:HDP

优点：原装hadoop

缺点：企业级安全不开源

以上所述就是小编给大家介绍的《新手入门大数据 Hadoop基础与电商行为日志分析（二）》，希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对码农网的支持！

查看所有标签

猜你喜欢:

本站部分资源来源于网络，本站转载出于传递更多信息之目的，版权归原作者或者来源机构所有，如转载稿涉及版权问题，请联系我们。

码农书籍

电脑报（上下册）

电脑报社 / 西南师范大学出版社 / 2006-12-01 / 45.00元

全套上、下两册，浓缩2006年电脑报精华文章。附录包含70余篇简明IT应用指南，覆盖软件、硬盘、数码、网络四大领域。配赠权威实用的2006-2007中国计算机年鉴DVD光盘，近1.4GB海量信息与资源超值奉献。8大正版超值软件，涵盖系统维护、系统安全、办公应用、多媒体娱乐等四大领域。微软、腾讯、友立等知名厂商，新年献礼。提供2006-2007全系列硬件、数码产品资讯，兼具知识性与资料性。官方网站全......一起来看看《电脑报（上下册）》这本书的介绍吧!

码农工具

新手入门大数据 Hadoop基础与电商行为日志分析（二）

电脑报（上下册）

图片转BASE64编码

HEX HSV 转换工具

HSV CMYK 转换工具