最新文章列表

对比测试 Snappy+RCFile组合 与 LZO+TextFile组合 的压缩比和查询性能

        在hadoop领域,上T数据的存储和处理是非常常见的。不同的存储格式和压缩组合能为存储和性能带来效率。本次对比测试 Snappy+RCFile组合 与  LZO+TextFile组合 的压缩比和查询性能,其结果见下面两个截图。至于hive、mr、压缩、存储格式等,这里不赘述,就在iteye搜索一下,都会出来一大堆。  
guiyu0856 评论(0) 有3810人浏览 2013-06-04 09:25

深入学习《Programing Hive》:RCFile

        在当前的基于Hadoop系统的数据仓库中,数据存储格式是影响数据仓库性能的一个重要因素。Facebook于是提出了集行存储和列存储的优点于一身 ...
flyingdutchman 评论(0) 有3488人浏览 2013-05-17 17:41

RcFile存储和读取操作

工作中用到了RcFile来存储和读取RcFile格式的文件,记录下。 RcFile是FaceBook开发的一个集行存储和列存储的优点于一身,压缩比更高,读取列更快,它在MapReduce环境中大规模数据处理中扮演着重要的角色。 读取操作: job信息: Job job = new Job(); job.setJarByClass(类.class); / ...
smallboby 评论(2) 有10328人浏览 2012-07-14 00:11

基于HIVE文件格式的map reduce代码编写

by hugh.wangp   我们的数据绝大多数都是在HIVE上,对HIVE的SEQUENCEFILE和RCFILE的存储格式都有利用,为了满足HIVE的数据开放,hive client的方式就比较单一,直 ...
hugh.wangp 评论(0) 有12758人浏览 2012-02-14 19:03

HIVE文件存储格式的测试比较

by hugh.wangp   根据自身涉及到的数据分布和使用需求,对HIVE上的三类文件格式做了如下测试,指导HIVE的文件格式选型。测试存在环境、数据分布、测试偏重点的不同,本测试只供参考,不作为大家选型决策的绝对指导。 HIVE的三种文件格式:TEXTFILE、SEQUENCEFILE、RCFILE中,TEXTFILE和SEQUENCEFILE的存储格式都是基于行存储的,RCFILE ...
hugh.wangp 评论(1) 有3638人浏览 2012-02-13 17:26

最近博客热门TAG

Java(141744) C(73651) C++(68608) SQL(64571) C#(59609) XML(59133) HTML(59043) JavaScript(54919) .net(54785) Web(54514) 工作(54118) Linux(50905) Oracle(49875) 应用服务器(43289) Spring(40812) 编程(39454) Windows(39381) JSP(37542) MySQL(37267) 数据结构(36424)

博客人气排行榜

    博客电子书下载排行

      >>浏览更多下载

      相关资讯

      相关讨论

      Global site tag (gtag.js) - Google Analytics