brandNewUser

浏览: 446934 次
性别:
来自: 北京

最近访客更多访客>>

yin_bp

ruize

candle_huihui

mwj3970839

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

hive默认分隔符引起的日志分割问题

博客分类：

hadoop&&storm

hive 外部表

Hive中的外部表

对于Hive中的外部表来说，因为表是外部的，Hive认为其并不拥有这份数据，删除该表并不会真正删除其中的数据，其中的表描述元信息会被删除掉。

对数据进行分区后，对于管理表，可以将其显示在hdfs目录中，但是外部表目录中不会真正存在数据，只能通过show partitions命令来显示外部表的分区信息。

我们的外部表是通过dateid进行的partition，如何显示某个partition外部表对应的location：

hive -e "describe extended xxx partition (dateid=20141230)"

显示出来的信息大致如下：

field1 string
dateid string

# Partition Information
# col_name data_type comment

dateid string

Detailed Partition Information Partition(values:[20141230], dbName:logbase_db, tableName:logbase, createTime:1419984079, lastAccessTime:0, sd:StorageDescriptor(cols:[FieldSchema(name:doc, type:string, comment:null), FieldSchema(name:dateid, type:string, comment:null)], location:hdfs://ns1/xxx/20141230, inputFormat:com.inputformat.XXXInputFormat, outputFormat:org.apache.hadoop.hive.ql.io.HiveIgnoreKeyTextOutputFormat, compressed:false, numBuckets:-1, serdeInfo:SerDeInfo(name:null, serializationLib:org.apache.hadoop.hive.serde2.lazy.LazySimpleSerDe, parameters:{serialization.format=1}), bucketCols:[], sortCols:[], parameters:{}, skewedInfo:SkewedInfo(skewedColNames:[], skewedColValues:[], skewedColValueLocationMaps:{}), storedAsSubDirectories:false), parameters:{numFiles=129, transient_lastDdlTime=1419984079, COLUMN_STATS_ACCURATE=false, numRows=-1, totalSize=170482370617, rawDataSize=-1})
Time taken: 0.994 seconds, Fetched: 9 row(s)

显示出来某个partition对应的hdfs地址等，使用的InputFormat等详细信息。

关于外部表创建的语句，完整内容大概如下：

CREATE [EXTERNAL] TABLE [IF NOT EXISTS] table_name
(col_name data_type, ...)
[PARTITIONED BY (col_name data_type, ...)]
[CLUSTERED BY (col_name, col_name, ...)]
[SORTED BY (col_name, col_name, ...)]
[ROW FORMAT row_formart]
[STORED AS file_format]
[LOCATION hdfs_path]
[AS select_statement]

当然，也可以通过使用Like复制一个已经存在的表定义：

CREATE [EXTERNAL] TABLE [IF NOT EXIST] table_name LIKE existing_table name
[LOCATION hdfs_path]

其中各个语句的含义如下：

CREATE TABLE：创建一个指定名字的表名。如果已经存在，使用IF NOT EXIST来忽略抛出的异常
EXTERNAL：创建一个外部表，也就是说在创建一个表的同时指定一个指向实际数据的路径。
LIKE：允许复制一个已经存在的表的定义，而不复制表中已经存在的内容。
PARTITIONED BY：建立带有分区的表。
CLUSTERED：对表和分区进行类聚操作。
SORT BY：根据某个字段进行排序，可以提高数据的查询效率。

如果要使用特定的InputFormat，还需要加入下面的语句：

INPUTFORMAT 'xxxHiveInputFormat'
     OUTPUTFORMAT 'org.apache.hadoop.hive.ql.io.HiveIgnoreKeyTextOutputFormat'
     LOCATION '/aaa/hive-table'

这样就指定InputFormat和OutputFormat，以及外部表的Location。其中InputFormat与Hadoop中的略有不同，其中的RecordReader需要特殊继承Hive中的

org.apache.hadoop.hive.ql.io.HiveContextAwareRecordReader

可以做一个Adaptor来将原有的RecordReader进行适配以满足Hive查询的要求。

Hive中的分隔符

hive 默认的字段分隔符为ascii码的控制符\001,建表的时候用fields terminated by '\001',如果要测试的话，造数据在vi 打开文件里面，用ctrl+v然后再ctrl+a可以输入这个控制符\001。按顺序，\002的输入方式为ctrl+v,ctrl+b。以此类推。

当前我们新建的Hive表中，默认fields terminated by没有设置，那么就使用'\001'。

比如我们的一条日志，表面上看起来没有问题：

cat a.log 
tp=imp^ti=1419076654^md=iPhone3,1^__tid=5zKN0REAy8M%253D^mh=640.00x960.00^me=7.1.2^mf=84fef4314602f88b90dad8f2a9d4b23dv1.1t1419076650kcom.qiyi.iphone^mk=1^plt=1^mn=iphone^m9=128f0ab5^os=i^mm=31.892004x119.898267x50.000000^mp=com.qiyi.iphone^e=i___m^mo=1^m5=9920F2E3-4BDB-430F-BCC3-6ACF6EC6F155^kt=mma^mt=1419076649529^a=UoNVX034P723^rawIp=222.185.12.59^mw=1^j=zh^k=2001515^av=11^ip=222.185.12.59^m0=604a45ed52a06f1535711e3c68a130f2edc^pf=c1^p=101324851^pu=m^pn=iphone^rt=2^uuid=9920f2e3-4bdb-430f-bcc3-6acf6ec6f155^po=http%3a%2f%2fmlt01.com%2fo.htm%3fpv%3d0%26sp%3d0%2c1195912%2c1199754%2c2213157%2c0%2c1%2c1^ag=34

但是通过cat -A(--show-all)，就可以看出所有的隐藏字符：

cat -A a.log
tp=imp^ti=1419076654^md=iPhone3,1^__tid=5zKN0REAy8M%253D^mh=640.00x960.00^me=7.1.2^mf=84fef4314602f88b90dad8f2a9d4b23dv1.1t1419076650kcom.qiyi.iphone^mk=1^plt=1^mn=iphone^m9=128f0ab5^os=i^mm=31.892004x119.898267x50.000000^mp=com.qiyi.iphone^e=i___m^mo=1^m5=9920F2E3-4BDB-430F-BCC3-6ACF6EC6F155^kt=mma^mt=1419076649529^a=UoNVX034P723^rawIp=222.185.12.59^mw=1^j=zh^k=2001515^av=11^ip=222.185.12.59^m0=604a45ed52a06f15357^A11e^@^@^@^@3c68a130f2edc^pf=c1^p=101324851^pu=m^pn=iphone^rt=2^uuid=9920f2e3-4bdb-430f-bcc3-6acf6ec6f155^po=http%3a%2f%2fmlt01.com%2fo.htm%3fpv%3d0%26sp%3d0%2c1195912%2c1199754%2c2213157%2c0%2c1%2c1^ag=34$

而其中看到的^A就是'\001'的表示（实际上是一个字符），这样外部表中该行数据^A前面的字符被截断导致该行数据只能显示前半部分。

最终的简单解决方法便是重写InputFormat，替换掉可能会导致问题的字符串特殊字符。

分享到：

MapReduce启动的Map/Reduce子任务简要分析 | Spring MVC中发布Restful Web服务

2015-01-10 21:09
浏览 7946
评论(0)
分类:开源软件
查看更多

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

hive默认分隔符引起的日志分割问题

Hive中的外部表

Hive中的分隔符

评论

发表评论

相关推荐

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

hive默认分隔符引起的日志分割问题

Hive中的外部表

Hive中的分隔符

评论

发表评论

相关推荐

Storm环境搭建和基本入门

理解Storm Metrics

Storm存储结果至Redis

Storm集成Kafka的Trident实现

Java程序中不通过hadoop jar的方式访问hdfs

oozie工作流相关入门整理

Hadoop MapReduce任务的启动分析

记一次数据处理效率优化过程

Hive语句执行优化－简化UDF执行过程

MapReduce启动的Map/Reduce子任务简要分析

locale错误导致Java中文乱码错误的总结

hadoop map任务Combiner被调用的源码逻辑简要分析

hadoop从调整GC到关键Counter计算原理分析

hadoop中使用hprof工具进行性能分析

hadoop map端的超时参数

hadoop Shuffle Error OOM错误分析和解决

hadoop中的一次集群任务执行超时问题查找过程

Hadoop Map/Reduce的工作流

Hive中的用户自定义函数UDF

hadoop集群调优－hadoop settings and MapReduce

最近访客更多访客>>