## Hadoop分布式数据分析系统概述 ### 一、Hadoop能为我们做什么! * 1、什么是大数据 大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。 * 2、大数据能用来做什么(如何挖掘企业需要的信息!) * 1>销售行业 * 什么类别的商品销售好,什么时段销售业绩高,根据分析淘汰销售不佳的商品或增加销售好的商品的进货。 * 2>生产行业 * 生产来源于市场需求,研发新商品淘汰滞销商品。 * 3>高校 * 就业率可以过滤专业或减少招生量。 * 4>医药行业 * 改变药品的种类和数量,决定药品的上架或下架。 * 5>医院 * 一种病的患病率上升还是下降,制定策略。 * 3、通常的关系数据库和大数据的联系和瓶颈 * 1>数据的存储介质 * 龟甲、竹片、纸张、Word、Excel、关系数据库。 * 2>关系数据库对于大量数据的读写 * 在数据库服务器上配置RAID磁盘阵列,这样能提高磁盘的访问性能,并能够实现容错/容灾。 * 3>RAID磁盘阵列可以提供数据库的读写速度,但是通常是在同一台服务器上配置,如果采用服务器集群,读写的速度也会受到影响。 * 4>存储的数据中有企业需要的数据信息 * 5>对于数据信息的数量,通过数据库的检索功能则需要很长的时间,效率和数据量成正比。 * 4、海量数据的产生是大数据分析系统产生的必然 * 1>计算机和数据库的使用积累了大量的数据。 * 2>关系数据库对大量数据的处理瓶颈。 * 3>数据库中的数据只能保存到历史表中,几乎成了垃圾数据。 * 4>但是大量的历史信息中隐藏着重要的信息确很难发现。 * 5>企业急需这些信息改变经营策略,以至于不被市场淘汰。 * 6>谁先对这些垃圾数据进行分析,谁将首先抢占市场或称为行业领导者。 * 7>网络的发展渗透到各个行业,通常的策略已经称为公开的秘密。 * 8>沉睡在历史表中的信息将被唤醒。 ### 二、Hadoop的起源 * Hadoop是一个由Apache基金会开发的一个开源项目,从2005 年开始,源于开源的收索引擎项目Nutch的一部分正式引入。Nutch项目的负责人是Doug Cutting,也是开发组的核心人员。 * Hadoop系统结构受到Google开发的Map/Reduce和Google File System (GFS) 的启发。 * 2006年,Map/Reduce和Nutch Distributed File System (NDFS)分别被纳入称为Hadoop的项目中。 * 最初Hadoop 是在 Internet 上对搜索关键字进行内容分类的工具,但是Hadoop对海量数据处理的能力备受关注。例如,如果您要对一个TB级别的文件进行关键字的出现次数进行统计,会出现什么情况!在传统的关系数据库系统上,这将需要很长的时间。但是 Hadoop 在设计时就考虑到这些问题,**采用分布并行执行机制**,因此能大大提高效率。 ### 三、Hadoop框架的组成 >HDFS(Hadoop Distributed File System),Hadoop分布式文件系统。 >Map/Reduce分布式计算系统



%E7%BB%93%E6%9E%84%E5%9B%BE.png)



