目录: 什么是大数据 Hadoop介绍-HDFS、MR、Hbase 大数据平台应用举例-腾讯 公司的大数据平台架构 “就像望远镜让我们能够感受宇宙,显微镜让我们能够观测微生物一样,大数据正在改变我们的生活以及理解世界的方式……”。 大数据的4V特征-来源 公司的“大数据” 随着公司业务的增长,大量和流程、规则相关的非结构化数据也爆发式增长。比如: 1、业务系统现在平均每天存储20万张图片,磁盘空间每天消耗100G; 2、平均每天产生签约视频文件6000个,每个平均250M,磁盘空间每天消耗1T; …… 三国里的“大数据” “草船借箭”和大数据有什么关系呢?对天象的观察是基于一种对风、云、温度、湿度、光照和所处节气的综合分析这些数据来源于多元化的“非结构”类型,并且数据量较大,只不过这些数据输入到的不是电脑,而是人脑并最终通过计算分析得出结论。深入浅出解析大数据平台架构 2 0 1 5 /1 /1 2 Google分布 式 计 算 的三驾 马 车 Google File System用来解决数据存储的问题,采用N多台廉价的电脑,使用冗余(也就是一份文件保存多份在不同的电脑之上)的方式,来取得读写速度与数据安全并存的结果。 Map-Reduce说穿了就是函数式编程,把所有的操作都分成两类,map与reduce,map用来将数据分成多份,分开处理,reduce将处理后的结果进行归并,得到最终的结果。 BigTable是在分布式系统上存储结构化数据的一个解决方案 ,解决了巨 大的Table的管 理、负 载 均衡的问题。 Hadoop体 系 架构 Hadoop核心设计深入浅出解析大数据平台架构 2 0 1 5 /1 /1 2 HDFS介绍-文件读流程 Client向NameNode发起文件读取的请求。 NameNode返回文件存储的DataNode的信息。 Client读取文件信息。 HDFS介绍-文件写流程深入浅出解析大数据平台架构 2 0 1 5 /1 /1 2 Client向NameNode发起文件写入的请求。 NameNode根据文件大小和文件块配置情况,返回给Client它所管理部分DataNode的信息。 Client将文件划分为多个Block,根据DataNode的地址信息,按顺序写入到每一个DataNode块中。 MapReduce——映射 、化 简 编 程模 型 输入数据->Map分解任务->执 行并返回结果->Reduce汇 总 结果->输出 结果 Hbase——分布式数据存 储 系统深入浅出解析大数据平台架构 2 0 1 5 /1 /1 2 Client:使用HBase RPC机制与HMaster和HRegionServer进行通信 Zookeeper:协同服务管理,HMaster通过Zookee...