`

Hadoop生态圈

 
阅读更多

什么是Hadoop?

The Apache™ Hadoop® project develops open-source software for reliable, scalable, distributed computing.

 

特点:

  • 扩容能力(Scalable):能可靠地(reliably)存储和处理千兆字节(PB)数据。
  • 成本低(Economical):可以通过普通机器组成的服务器群来分发以及处理数据。这些服务器群总计可达数千个节点。
  • 高效率(Efficient):通过分发数据,hadoop可以在数据所在的节点上并行地(parallel)处理它们,这使得处理非常的快速。
  • 可靠性(Reliable):hadoop能自动地维护数据的多份副本,并且在任务失败后能自动地重新部署(redeploy)计算任务。

主要解决:

  • 海量数据的存储(HDFS)
  • 海量数据的分析(MapReduce)
  • 资源管理调度(YARN)

Hadoop生态系统


 

Hadoop生态圈

 

Hadoop1.0和Hadoop2.0的对比


 

YARN(Yet Another Resource Negotiator,另一种资源协调者)产生背景:

直接源于MRv1在几方面的无能:

1.扩展受限

2.单点故障

3.难以支持MR之外的计算

多框架各自为战,数据共享困难

1.MR离线计算框架

2.Storm实时计算框架

3.Spark内存计算框架

 

 

 

  • 大小: 595.3 KB
  • 大小: 467.7 KB
  • 大小: 66.2 KB
分享到:
评论

相关推荐

Global site tag (gtag.js) - Google Analytics