加米谷大数据 发表于 2018-1-5 11:23:23

加米谷大数据 | Hbase的数据坐标


Hbase在表里存储数据使用的是四维坐标系统。分别是:行健、列族、列限定符和时间版本。
如:
列族A
行健列限定符(name) 列限定符(email)         列限定符C(password)
aaa单元(value1) 单元(value4)   单元(value7)
bbb单元(value2) 单元(value5)   单元(value8)
ccc单元(value3) 单元(value6)   时间版本1:单元(value9),时间版本2:单元(value10)


行健按照字典排序,一行具有一个行健,唯一且一行具有多个列族,每个列族下有一个或多个列限定符,每个列限定符下有多个单元,每个单元默认具有3个时间版本的值。
单元的新建、修改和删除都会留下新时间版本,当没有设定时间版本时,HBase以毫秒为单位使用当前时间,所以版本数字用长整型long表示。单元里数据的每个版本提交一个KeyValue实例给Result。
可用方法getTimestamp()来获取KeyValue实例的版本信息。如果一个单元的版本超过了最大数量,多出的记录在下一次大合并时会扔掉。
除了删除整个整个单元,你也可以删除一个或介个特定的版本。deleteColumns() (带s)处理小于指定时间版本的所有KeyValue,不指定则为当前时间now,则相当于删除了该单元,而方法

deleteColumn()只删除一个时间版本。


把所有坐标视为一个整体,Hbase可看做一个键值数据库,可把单元数据看做值。当使用Hbase API检索数据时,不需提供全部坐标,如果在GET命令中省略了时间版本,将返回多个时间版本的映射集合。
可以在一次操作中,获取多个数据,按坐标的降序列。
如果是全维度坐标,将得到指定单元值。去掉时间版本后,得到一个从时间戳列值的映射。再继续去掉列限定符,得到一个指定列族下的所有列限定符的映射。最后去掉列族,将得到一行的映射。


成都加米谷大数据科技有限公司是一家专注于大数据人才培养的机构。由来自阿里、华为、京东、星环等国内知名企业的多位技术大牛联合创办,技术底蕴丰厚,勤奋创新,精通主流前沿大数据及人工智能相关技术。以国家规划大数据产业发展战略为指引,以全国大数据技术和大数据分析人才的培养为使命,以提升就业能力、强化职业技术为目标。面向社会提供大数









页: [1]
查看完整版本: 加米谷大数据 | Hbase的数据坐标