hive merge file - - ITeye博客

`

skywhsq1987

浏览: 241686 次

最近访客更多访客>>

loginboot

zhouzbit

zjxlt

a536714704

博主相关

博客

微博

相册

收藏

留言

关于我

文章分类

社区版块

存档分类

最新评论

grzrt： ...
MySQL innodb 的间隙锁定（next-key locking）

hive merge file

博客分类：

hive

阅读更多

当Hive输入由很多个小文件组成，由于每个小文件都会启动一个map任务，如果文件过小，以至于map任务启动和初始化的时间大于逻辑处理的时间，会造成资源浪费，甚至OOM。
为此，当我们启动一个任务，发现输入数据量小但任务数量多时，需要注意在Map前端进行输入合并
当然，在我们向一个表写数据时，也需要注意输出文件大小

1. Map输入合并小文件
对应参数：
set mapred.max.split.size=256000000; #每个Map最大输入大小
set mapred.min.split.size.per.node=100000000; #一个节点上split的至少的大小
set mapred.min.split.size.per.rack=100000000; #一个交换机下split的至少的大小
set hive.input.format=org.apache.hadoop.hive.ql.io.CombineHiveInputFormat; #执行Map前进行小文件合并

在开启了org.apache.hadoop.hive.ql.io.CombineHiveInputFormat后，一个data node节点上多个小文件会进行合并，合并文件数由mapred.max.split.size限制的大小决定。
mapred.min.split.size.per.node决定了多个data node上的文件是否需要合并~
mapred.min.split.size.per.rack决定了多个交换机上的文件是否需要合并~

2.输出合并
set hive.merge.mapfiles = true #在Map-only的任务结束时合并小文件
set hive.merge.mapredfiles = true #在Map-Reduce的任务结束时合并小文件
set hive.merge.size.per.task = 256*1000*1000 #合并文件的大小
set hive.merge.smallfiles.avgsize=16000000 #当输出文件的平均大小小于该值时，启动一个独立的map-reduce任务进行文件merge

分享到：

Hive 数据倾斜总结 | Hive MapJoin 优化

2014-01-11 10:12
浏览 901
评论(0)
分类:互联网
查看更多

评论

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

hive: hive hive hive hive hive hive hive hive hive hive hive hive

Hive3.1.2编译源码: 使用hive3.1.2和spark3.0.0配置hive on spark的时候，发现官方下载的hive3.1.2和spark3.0.0不兼容，hive3.1.2对应的版本是spark2.3.0，而spark3.0.0对应的hadoop版本是hadoop2.6或hadoop2.7。所以，如果想要使用高...

hive-jdbc hive jdbc驱动: hive-jdbc

Hive表生成工具，Hive表生成工具Hive表生成工具: Hive表生成工具，Hive表生成工具Hive表生成工具

Hive使用手册Hive使用手册: 1 Hive 概念与连接使用: 2 2 Hive支持的数据类型： 2 2.1原子数据类型： 2 2.2复杂数据类型： 2 2.3 Hive类型转换： 3 3 Hive创建/删除数据库 3 3.1创建数据库: 3 3.2 删除数据库: 3 4 Hive 表相关语句 3 4.1 Hive ...

《Hive数据仓库案例教程》教学课件第5章 Hive数据操作.pdf: 《Hive数据仓库案例教程》教学课件第5章 Hive数据操作.pdf《Hive数据仓库案例教程》教学课件第5章 Hive数据操作.pdf《Hive数据仓库案例教程》教学课件第5章 Hive数据操作.pdf《Hive数据仓库案例教程》教学课件第...

hive-3.1.1安装包: Hive是一个基于Hadoop的数据仓库工具，它本身并不存储数据，部署在Hadoop集群上，数据是存储在HDFS上的. Hive所建的表在HDFS上对应的是一个文件夹，表的内容对应的是一个文件。它不仅可以存储大量的数据而且可以对...

Hive.sql，hive的元数据: Hive.sql

Hive新手学习资料之Hive入门与实战.+Hive用户手册+hive函数大全中文版资源合集: Hive是基于Hadoop的一个数据仓库工具，可以将结构化的数据文件映射为一张数据库表，并提供类SQL查询功能。 hive是基于Hadoop的一个数据仓库工具，用来进行数据提取、转化、加载，这是一种可以存储、查询和分析存储...

hivesql语句练习: 5.安装hive和mysq完成后，将mysql的连接jar包拷贝到$HIVE_HOME/lib目录下如果出现没有权限的问题，在mysql授权(在安装mysql的机器上执行) mysql -uroot -p #(执行下面的语句 *.*:所有库下的所有表 %：任何IP地址...

Ambari下Hive3.0升级到Hive4.0: Ambari下Hive3.0升级到Hive4.0，验证自测；

Hive总结.docx: Hive原理/Hive SQL/Hive 函数/数据仓库分层和建模/Hive sql优化/数据倾斜

flink 1.14.4 集成 hive 3.12 的依赖包: flink 集成 hive 所需要的依赖包，包括 antlr-runtime-3.5.2.jar flink-connector-hive_2.12-1.14.4.jar flink-shaded-hadoop-3-3.1.1.7.2.9.0-173-9.0.jar flink-sql-connector-hive-3.1.2_2.12-1.14.4.jar hive-...

利用Hive进行复杂用户行为大数据分析及优化案例: 利用Hive进行复杂用户行为大数据分析及优化案例（全套视频+课件+代码+讲义+工具软件），具体内容包括： 01_自动批量加载数据到hive 02_Hive表批量加载数据的脚本实现（一） 03_Hive表批量加载数据的脚本实现（二） ...

hive学习总结思维导图.xmind: 由于 Hive 采用了类似SQL 的查询语言 HQL(Hive Query Language)，因此很容易将 Hive 理解为数据库。其实从结构上来看，Hive 和数据库除了拥有类似的查询语言，再无类似之处。本文将从多个方面来阐述 Hive ...

Hive优化方法整理: Hive优化方法整理 hive 数据倾斜内连接

hive构造测试数据方法: hive造数据

Hive用户指南(Hive_user_guide)_中文版.pdf: （” n”）以及读取文件数据的方法（ Hive 中默认有三个文件格式 TextFile ， SequenceFile 以及 RCFile ）。由于在加载数据的过程中，不需要从用户数据格式到 Hive 定义的数据格式的转换，因此， Hive 在加载的...

hive数仓、hive SQL 、 hive自定义函数、hive参数深入浅出: hive数仓、hive SQL 、 hive自定义函数、hive参数深入浅出

Global site tag (gtag.js) - Google Analytics