Pig系统分析(2)

php中文网
发布: 2016-06-07 15:08:42
原创
1649人浏览过

Pig哲学之一——Pigs Eat Anything。Pig能够从不同数据源加载数据,能够处理不同式的数据。Pig使用Loader/Store进行数据加载和存储,可选地使用Schema指定数据列名称和类型。如果加载数据时不指定Schema,数据列未命名,类型默认是字节数组(bytearray),在后

pig哲学之一——pigs eat anything。pig能够从不同数据源加载数据,能够处理不同格式的数据。pig使用loader/store进行数据加载和存储,可选地使用schema指定数据列名称和类型。如果加载数据时不指定schema,数据列未命名,类型默认是字节数组(bytearray),在后续操作中,pig可以通过位置参数引用数据列,会根据在数据列上进行的操作进行自动类型转化。从性能和可读性考虑,最好在加载数据时指定schema。

Loader体系

Loader的基类是org.apache.pig.LoadFunc,规定了Loader需要实现的接口,并提供了一些默认实现。下图是Loader的继承体系,针对不同数据源,Pig实现了大量Loader,包括HBaseStorage和ParquestLoader等,能够处理列式存储。默认的Loader是PigStorage。

Pig系统分析(2)

org.apache.pig.LoadFunc中的三个基本的方法决定了Where/What/How:

public abstractvoidsetLocation(String location, Job job) throws IOException
public abstractInputFormat getInputFormat() throws IOException
public LoadCaster getLoadCaster() throws IOException {
            return new Utf8StorageConverter();
}
登录后复制
  1. 指定加载位置。
  2. 指定数据源类型,使用HDFS的InputFormat处理不同数据源。
  3. 如何处理数据从字节数组到实际类型的转化,默认使用Utf8StorageConverter

PigStore分析

1)  处理压缩格式,通过加载文件后缀加载不同的InputFormat:

@Override
public InputFormat getInputFormat() {
    if(loadLocation.endsWith(".bz2") || loadLocation.endsWith(".bz")) {
        return newBzip2TextInputFormat();
    } else {
        return newPigTextInputFormat();
    }
}
登录后复制
2)  读取数据:读取数据之前先代用prepareToRead方法设置InputFormat对应的RecordReader,通过RecordReader读取每行数据,根据用户指定的分隔符处理每行文本,最终转换成元组。
public void prepareToRead(RecordReader reader,PigSplit split)
@Override
public Tuple getNext() throws IOException
登录后复制

3)  Schema处理,在getNext方法中,如果存在Schema,会对元组应用applySchema方法,给元组中的数据项指定名称和类型。

其他重要接口

通过实现其他一些接口,Loader能提供一些附加功能

LoadMetaData

  1. 通过getSchema方法自动加载Schema
  2. 通过getPartitionKeys方法设置数据的分区键,把用户查询条件中的分区键通过setPartitionFilter直接传递给Loader,减少数据加载。参见HCatLoader中实现,注:org.apache.hcatalog.pig.HCatLoader

LoadPushDown

在使用RCFile等基于列格式文件时,如果每次都加载所有列对性能影响较大。如果实现了LoadPushDown接口,优化器会将所需要用到的字段传递给pushProjection方法。

LoadCaster

自定义字节数组到Schema中数据类型的转换,通过一系列方法能够自定义字节数组到到Pig的标量和复杂数据类型的转化。默认实现为Utf8StorageConverter,其中的复杂数据类型格式固定,比如元组格式为(),map格式为[],bag为{}。

AMiner
AMiner

AMiner——新一代智能型科技情报挖掘与服务系统,能够为你提供查找论文、理解论文、分析论文、写作论文四位一体一站式服务。

AMiner 1363
查看详情 AMiner

Store体系

与org.apache.pig.LoadFunc对应,Pig中也存在org.apache.pig.StoreFunc抽象类。由于不少Loader(比如默认的PigStorage)同样实现了store功能,受Java单继承的限制,Pig提供了StoreFuncInterface接口。

Pig系统分析(2)

Store的实现与Loader对应,将实际输出操作委托给OutputFormat。值得注意的是,与LoadMetadata对应,Pig也提供了StoreMetadata接口用于处理元数据的存储。.

Schema结构

Schema描述了一个数据集合每一行的列名称和数据类型,其中每一个列信息用FieldSchema表示。FieldSchema通常包括列名称、数据类型,如果列本身是bag的话,FieldSchema还会拥有自己的Schema。

Pig系统分析(2)

参考价值

  1. 目前Pig针对逻辑执行计划的优化器都是基于规则的,如果要实现基于代价的优化,需要更多关于数据的统计信息,那么加载和存储数据应该是重要入口和出口。在LoadMetadata/StoreMetadata接口中已经存在getStatistics/setStatistics方法,ResourceStatistics包含行数、行大小、列直方图、区分度等统计信息,不过现在在PigStorage中是空实现。
  2. 如果要实现Pig On Spark,Loader体系中需要加入RDD层,演变为Loader-RDD-HDFS三层结构。HDFS存储可以考虑ORCFile等列式存储格式,基于成本的优化可以参考Hive中的实现
最佳 Windows 性能的顶级免费优化软件
最佳 Windows 性能的顶级免费优化软件

每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。

下载
来源:php中文网
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
开源免费商场系统广告
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号