Apache Pig字符串截取实战小例子

博客分类：

记录一个Pig字符串截取的实战小例子：

需求如下，从下面的字符串里提取出第2列（冒号后面）的值：

1 2  3 4
a:ab#c#d
a:c#c#d
a:dd#c#d
a:zz#c#d

如果是在java里，方法可能有很多种，比如substring，或者split多次等，在pig也大致如此，可以使用SUBSTRING内置函数来完成，但散仙推荐使用下面的方式，这种方式比较灵活，适合大部分场景的数据提取，需要用到的2个函数如下：

（1）REGEX_EXTRACT（'原始字符串','正则式',int类型的返回索引）

（2）STRSPLIT('原始字符串', '正则式', 限制返回的个数)

pig脚本写法：


a = laod '/tmp/data' as (data:chararray)
//注意逻辑是，先获取冒号后面的数据，然后split成tuple，再通过$1（下标访问元素）获取我们需要的数据即可。
b = foreach a generate STRSPLIT (REGEX_EXTRACT (data, '(.*):(.*)', 2) ,'#',5).$0;

dump b;

想了解更多有关电商互联网公司的搜索技术和大数据技术的使用，请欢迎扫码关注微信公众号：我是攻城师（woshigcs）
本公众号的内容是有关搜索和大数据技术和互联网等方面内容的分享，也是一个温馨的技术互动交流的小家园，有什么问题随时都可以留言，欢迎大家来访！

0
顶

0
踩

分享到：

ElasticSearch入门之彼行我释（四） | 玩转大数据系列之Apache Pig如何通过自定义 ...

2015-03-13 17:23
浏览 2230
评论(0)
分类:编程语言
查看更多

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

博客专栏

文章分类

社区版块

存档分类

最新评论

Apache Pig字符串截取实战小例子

评论

发表评论

相关推荐

最近访客 更多访客>>

博主相关

博客专栏

文章分类

社区版块

存档分类

最新评论

Apache Pig字符串截取实战小例子

评论

发表评论

相关推荐

Apache Tez0.7编译笔记

Bug死磕之hue集成的oozie+pig出现资源任务死锁问题

Apache Pig中如何使用Replace函数

Apache Pig的UDF返回值问题

Pig0.15集成Tez，让猪飞起来

CDH-Hadoop2.6+ Apache Pig0.15安装记录

Pig配置vim高亮

Hadoop2.2如何集成Apache Pig0.12.1？

Apache Pig和Solr问题笔记（一）

Pig使用问题总结

玩转大数据系列之Apache Pig高级技能之函数编程（六）

玩转大数据系列之Apache Pig如何通过自定义UDF查询数据库（五）

玩转大数据系列之如何给Apache Pig自定义存储形式（四）

玩转大数据系列之Apache Pig如何与MySQL集成（三）

玩转大数据系列之Apache Pig如何与Apache Solr集成（二）

玩转大数据系列之Apache Pig如何与Apache Lucene集成（一）

Apache Pig学习笔记之内置函数（三）

Apache Pig学习笔记（二）

你有一个好的归档习惯吗？

Apache Pig入门学习文档（一）

最近访客更多访客>>