快捷導(dǎo)航

詳解hbase與hive數(shù)據(jù)同步

更新時(shí)間：2017年09月27日 10:39:06 投稿：mrr

這篇文章主要介紹了詳解hbase與hive數(shù)據(jù)同步的相關(guān)資料,需要的朋友可以參考下

hive的表數(shù)據(jù)是可以同步到impala中去的。一般impala是提供實(shí)時(shí)查詢操作的，像比較耗時(shí)的入庫操作我們可以使用hive，然后再將數(shù)據(jù)同步到impala中。另外，我們也可以在hive中創(chuàng)建一張表同時(shí)映射hbase中的表，實(shí)現(xiàn)數(shù)據(jù)同步。

下面，筆者依次進(jìn)行介紹。

一、impala與hive的數(shù)據(jù)同步

首先，我們?cè)趆ive命令行執(zhí)行showdatabases;可以看到有以下幾個(gè)數(shù)據(jù)庫：

然后，我們?cè)趇mpala同樣執(zhí)行showdatabases;可以看到：

目前的數(shù)據(jù)庫都是一樣的。

下面，我們?cè)趆ive里面執(zhí)行create databaseqyk_test;創(chuàng)建一個(gè)數(shù)據(jù)庫，如下：

然后，我們使用qyk_test這個(gè)數(shù)據(jù)庫創(chuàng)建一張表，執(zhí)行create table user_info(idbigint, account string, name string, age int) row format delimitedfields terminated by ‘\t';如下：

此時(shí)，我們已經(jīng)在hive這邊創(chuàng)建好了，然后直接在impala這邊執(zhí)行showdatabases;可以看到：

連qyk_test這個(gè)數(shù)據(jù)庫都沒有。

接下來，我們?cè)趇mpala執(zhí)行INVALIDATEMETADATA;然后再查詢可以看到：

數(shù)據(jù)庫和表都會(huì)同步過來。

好了，筆者來做個(gè)總結(jié)：

如果在hive里面做了新增、刪除數(shù)據(jù)庫、表或者數(shù)據(jù)等更新操作，需要執(zhí)行在impala里面執(zhí)行INVALIDATEMETADATA;命令才能將hive的數(shù)據(jù)同步impala；

如果直接在impala里面新增、刪除數(shù)據(jù)庫、表或者數(shù)據(jù)，會(huì)自動(dòng)同步到hive，無需執(zhí)行任何命令。

二、hive與hbase的數(shù)據(jù)同步

首先，我們?cè)趆base中創(chuàng)建一張表create ‘user_sysc', {NAME =>‘info'}，然后，我們?cè)趆ive中執(zhí)行

CREATEEXTERNALTABLEuser_sysc(keyint,valuestring)ROWFORMATSERDE 'org.apache.hadoop.hive.hbase.HBaseSerDe'
STORED BY'org.apache.hadoop.hive.hbase.HBaseStorageHandler'
WITHSERDEPROPERTIES( 'serialization.format'='\t','hbase.columns.mapping'=':key,info:value','field.delim'='\t')
TBLPROPERTIES ('hbase.table.name'='user_sysc')

創(chuàng)建一張外部表指向hbase中的表，然后，我們?cè)趆ive執(zhí)行insert into tableuser_sysc select id,name fromuser_info;入一步份數(shù)據(jù)到user_sysc可以看到：