HDFS的架构要点-xiong9937-ChinaUnix博客

storage&nbsp;architect

首页　| 　博文目录　| 　关于我

xiong9937

博客访问： 1975363
博文数量： 1000
博客积分： 0
博客等级：民兵
技术积分： 7921
用户组：普通用户
注册时间： 2013-08-20 09:23

个人简介

storage R&D guy.

文章分类

全部博文（1000）

hh（5）
python（1）
flashcache（2）
levelDB（12）
java（4）
mac（5）
zookeeper（73）
ceph（108）
investation（2）
raid（3）
USB（21）
raise（1）
others（2）
salary（2）
salary（0）
KVM（11）
3G（2）
SAS（3）
PMC（2）
cold（24）
algorithm（9）
HDFS（92）
HDFS（4）
gdb（5）
hp（1）
DDK（27）
C（25）
eclipse（3）
tools（52）
kernel（37）
iscsi（19）
HPC（1）
FS（35）
scst（15）
istributed （5）
cloud（19）
NAS（41）
intel（1）
algorithm（0）
command（2）
tcpip（18）
documents（2）
board（1）
memory（13）
management（1）
linux boot（34）
bios（3）
pcie（56）
memory（3）
ethnet（56）
driver（3）
fcoe（13）
FC（14）
english（4）
switch（2）
links（14）
private（0）
protocal（0）
office（2）
network（2）
vm（8）
database（1）
os（43）
storage（27）

fcoe（4）
server（3）
未分配的博文（1）

文章存档

2019年（5）

2017年（47）

2016年（38）

2015年（539）

2014年（193）

2013年（178）

我的朋友

相关博文

HDFS的架构要点

分类：服务器与存储

2015-01-13 13:39:42

HDFS的架构采用master/slave模式，一个HDFS集群是由一个Namenode和多个Datanode组成。

在HDFS集群中，只有一个Namenode结点。Namenode作为HDFS集群的中心服务器，主要负责：

1、管理HDFS集群中文件系统的名字空间（Namespace），例如打开文件系统、关闭文件系统、重命名文件或者目录等；另外，对任何请求对文件系统名字空间或者属性进行修改的操作，都被Namenode记录下来。

2、管理客户端对HDFS集群中的文件系统中的文件的访问，实际上文件以块的形式存储在Datanode上，文件系统客户端向Namenode请求所要执行操作的文件块（该块存储在指定的Dadanode数据结点上），然后通过与Datanode结点交互来完成文件读写的操作。那么，文件系统客户端与Namenode交互的过程中，只有从Namenode中获取到了所请求的文件块所对应的Datanode结点，才能执行文件的读写操作。也就是说，Namenode结点还负责确定指定的文件块到具体的Datanode结点的映射关系。

3、管理Datanode结点的状态报告，包括Datanode结点的健康状态报告和其所在结点上数据块状态报告，以便能够及时处理失效的数据结点。

在HDFS集群中，一个Datanode结点可以存在多个，一般是一个结点上对应一个Datanode实例。Datanode数据结点进程的任务是：

1、负责管理它所在结点上存储的数据的读写。一般是文件系统客户端需要请求对指定数据结点进行读写操作，Datanode作为数据结点的服务进程来与文件系统客户端打交道。同时，是否需要执行对文件块的创建、删除、复制等操作，Datanode数据结点进程还要在Namenode的统一指挥调度下完成，当与Namenode交互过程中收到了可以执行文件块的创建、删除或复制操作的命令后，才开始让文件系统客户端执行指定的操作。具体文件的操作并不是Datanode来实际完成的，而是经过Datanode许可后，文件系统客户端进程来执行实际操作。

2、向Namenode结点报告状态。每个Datanode结点会周期性地向Namenode发送心跳信号和文件块状态报告，以便Namenode获取到工作集群中Datanode结点状态的全局视图，从而掌握它们的状态。如果存在Datanode结点失效的情况时，Namenode会调度其它Datanode执行失效结点上文件块的复制处理，保证文件块的副本数达到规定数量。

3、执行数据的流水线复制。当文件系统客户端从Namenode服务器进程获取到要进行复制的数据块列表（列表中包含指定副本的存放位置，亦即某个Datanode结点）后，会首先将客户端缓存的文件块复制到第一个Datanode结点上，此时并非整个块都复制到第一个Datanode完成以后才复制到第二个Datanode结点上，而是由第一个Datanode向第二个Datanode结点复制，……，如此下去完成文件块及其块副本的流水线复制。

通过上面的叙述，可以看到，在HDFS集群中，存在三个主要的进程：Namenode进程、Datanode进程和文件系统客户端进程，这三个进程之间都是基于Hadoop实现的RPC机制进行通信的，该IPC模型基于Client/Server模式进行通信。因此上述三个进程之间存在如下端到端通信与交互：

1、（Client）Datanode / Namenode（Server）

2、（Client）DFS Client / Namenode（Server）

3、（Client）DFS Client / Datanode（Server）

4、（Client）Datanode A / Datanode B（Server）

阅读(789) | 评论(0) | 转发(0) |

上一篇：hdfs

下一篇：gossip协议

给主人留下些什么吧！~~

感谢所有关心和支持过ChinaUnix的朋友们

16024965号-6