新手入门大数据 Hadoop基础与电商行为日志分析(二)

栏目: 编程工具 · 发布时间: 5年前

内容简介:HDFS:文件,块,副本假如:一个文件test.log,大小为200M,

HDFS:

文件,块,副本

假如:一个文件test.log,大小为200M,

一块(block),默认的blocksize是128M, 两个块=一个128M + 一个72M
  副本:HDFS默认3副本
 
  三个机器:node1:blk1 blk2 即使第一台机器挂掉了,也不影响
          node2:blk1
          node3:blk2
          node4:blk1 blk2

MapReduce:一个经典的wordcount的问题

文件内容:bear,apple,this,

some,you,love,apple,
     love,bear,this

先是split,分成一行一行的,然后map,每行的单个内容分开,{bear,1},{apple,1}{this,1}然后shuffle,{bear,[1,1]},{apple,[1,1]},{this,[1,1]},最后reduce得到最终结果{bear,2},{apple,2},{this,2}

YARN 资源调度器, Yet Another Resource Negotiator

负责整个集群的资源管理和调度

常用的hadoop发行版及选择:

Apache

优点:纯开源

缺点:不同版本/不同框架之间会有jar包冲突

CDH

优点:cm(cloudera manager)通过页面一键安装各种框架 升级

缺点:cm不开源

Hortonworks:HDP

优点:原装hadoop

缺点:企业级安全不开源


以上所述就是小编给大家介绍的《新手入门大数据 Hadoop基础与电商行为日志分析(二)》,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对 码农网 的支持!

查看所有标签

猜你喜欢:

本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们

写给大家看的设计书(第4版)

写给大家看的设计书(第4版)

Robin Williams / 苏金国、李盼 / 人民邮电出版社 / 2016-1 / 59.00元

畅销设计入门书最新版,让每个人都能成为设计师 在这个创意无处不在的时代,越来越多的人成为设计师。简历、论文、PPT、个人主页、博客、活动海报、给客人的邮件、名片……,处处都在考验你的设计能力。 美术功课不好?没有艺术细胞?毫无设计经验? 没关系!在设计大师RobinWilliams看来,设计其实很简单。在这部畅销全球多年、影响了一代设计师的经典著作中,RobinWilliams将......一起来看看 《写给大家看的设计书(第4版)》 这本书的介绍吧!

图片转BASE64编码
图片转BASE64编码

在线图片转Base64编码工具

UNIX 时间戳转换
UNIX 时间戳转换

UNIX 时间戳转换