Hadoop -HDFS、YARN与MapReduce基本概念
HDFS
hadoop Distributed FileSystem:hadoop 分布式文件系统
-检索:NameNode(1个):管理有在HDFS上所存储的文件的元数据
-存储:DataNode(多个):真正负责存储数据的节点
以块为单位,对文件进行切分,实现分布式存储。
-辅助: SecondaryNameNode:(可选,1个)负责辅助NameNode工作
YARN:
负责分布式集群中所有资源的管理和调度
核心进程:
ResourceManager:(1个)资源管理者:负责整个集群中所有节点资源的管理和调度
NodeManager:(N个)节点资源管理者,负责单个节点资源的管理和调度
运行MR任务时:
ApplicationMaster:单个Job在运行在YARN上时,启动一个当前job的AppMR,这个进程负责这个Job所有Task资源申请,以及状态检测,容错
Container:计算资源的抽象表达,一个Container中封装了若干计算资源,例如,CPU,内存。每个task都需要一个container
作用:将当前Task计算所需的资源,进行隔离,防止被其他task占用。
MapReduce:
mapReduce时编程模型,一个程序只有按照MapReduce指定的模型进行编程,才能运行在Yarn上
Job:一个编写好的MapReduce程序,称为一个Job
job运行两阶段:
Map阶段:将总数据且分为多片,每一片交由一个进程执行,该进程称为MapTask
Reduce阶段:负责将多个MapTask产生的结果进行合并!这个合并的进程称为ReduceTask!
一个Job会启动多个MapTask和多个ReduceTask!
更多推荐




所有评论(0)