hbase rowkey 设计(三维有序)

php中文网
发布: 2016-06-07 16:29:25
原创
1191人浏览过

此文原创,转载请说明出处:http://ronxin999.blog.163.com/blog/static/4221792020130109202973/ 看这篇文章,你首先要了解hbase的基本存储模型,不懂的可以看我的文章,有做特别的说明。 今天难得有时间,写博文,特地总结下一直想写hbase的实践经验,在用


此文原创,转载请说明出处:http://ronxin999.blog.163.com/blog/static/4221792020130109202973/

看这篇文章,你首先要了解hbase的基本存储模型,不懂的可以看我的文章,有做特别的说明。
今天难得有时间,写博文,特地总结下一直想写hbase的实践经验,在用hbase的过程中,我们都知道,rowkey设计的好坏,是我们能最大发挥hbase的架构优势,也是我们是否正确理解hbase的一个关键点。闲话少说,进入正题。

hbase所谓的三维有序存储的三维是指:rowkey(行主键),column key(columnfamily+qualifier),timestamp(时间戳)三部分组成的三维有序存储。

先 说rowkey,我们知道rowkey是行的主键,而且hbase只能用个rowkey,或者一个rowkey范围即scan来查找数据。所以 rowkey的设计是至关重要的,关系到你应用层的查询效率。我们知道,rowkey是以字典顺序排序的。而存储的字节码,字典排序,我们知道,如果是字 母,那就是字母的顺序,比如,有两个rowkey,rowkey1:aaa222,rowkey2:bbb111,那么rowkey1是排在 rowkey2前面的,因为按字典,a排在b前面,如果rowkey2的第一位也是a,那么就根据第二位来比较,如果还相同,则比较第三为,后面同样。这 个理解了,我们在根据rowkey范围查询的时候,我们一般是知道startrowkey,如果我们通过scan只传startrowkey : d开头的,那么查询的是所有比d大的都查了,而我们只需要d开头的数据,那就要通过endrowkey来限制。我们可以通过设定endrowkey为:d 开头,后面的根据你的rowkey组合来设定,一般是加比startkey大一位。比如说rowkey设计为:用户id-日期,那么查某个用户某天的数 据,startkey为3231-20121212,endkey为:3231+201213,那么你查到的就是用户为3231在20121212这一天 的数据。

column key

column key是第二维,数据按rowkey字典排序后,如果rowkey相同,则是根据column key来排序的,也是按字典排序。
我们在设计table的时候要学会利用这一点。比如我们的收件箱。我们有时候需要按主题排序,那我们就可以把主题这设置为我们的column key,即设计为columnfamily+主题.,这样的设计。

timestamp

timestamp 时间戳,是第三维,这是个按降序排序的,即最新的数据排在最前面。这个就没有什么说的了。网上其他的博客也提到比较多。

这篇文章主要是帮助朋友们理解rowkey的字典排序即(三维有序)。希望对你有帮助。

hbase rowkey 设计(三维有序)

最佳 Windows 性能的顶级免费优化软件
最佳 Windows 性能的顶级免费优化软件

每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。

下载
来源:php中文网
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
开源免费商场系统广告
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送
PHP中文网APP
随时随地碎片化学习
PHP中文网抖音号
发现有趣的

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号