快捷導(dǎo)航

詳解Flink同步Kafka數(shù)據(jù)到ClickHouse分布式表

更新時(shí)間：2022年12月01日 10:03:42 作者：大數(shù)據(jù)技術(shù)派

這篇文章主要為大家介紹了Flink同步Kafka數(shù)據(jù)到ClickHouse分布式表實(shí)現(xiàn)詳解，有需要的朋友可以借鑒參考下，希望能夠有所幫助，祝大家多多進(jìn)步，早日升職加薪

引言

業(yè)務(wù)需要一種OLAP引擎，可以做到實(shí)時(shí)寫(xiě)入存儲(chǔ)和查詢計(jì)算功能，提供高效、穩(wěn)健的實(shí)時(shí)數(shù)據(jù)服務(wù)，最終決定ClickHouse

什么是ClickHouse？

ClickHouse是一個(gè)用于聯(lián)機(jī)分析(OLAP)的列式數(shù)據(jù)庫(kù)管理系統(tǒng)(DBMS)。

列式數(shù)據(jù)庫(kù)更適合于OLAP場(chǎng)景(對(duì)于大多數(shù)查詢而言，處理速度至少提高了100倍)，下面詳細(xì)解釋了原因(通過(guò)圖片更有利于直觀理解)，圖片來(lái)源于ClickHouse中文官方文檔。

行式

列式

我們使用Flink編寫(xiě)程序，消費(fèi)kafka里面的主題數(shù)據(jù)，清洗、歸一，寫(xiě)入到clickhouse里面去。

這里的關(guān)鍵點(diǎn)，由于第一次使用，無(wú)法分清應(yīng)該建立什么格式的clickhouse表，出現(xiàn)了一些問(wèn)題，最大的問(wèn)題就是程序?qū)?shù)據(jù)寫(xiě)入了，查詢發(fā)現(xiàn)數(shù)據(jù)不完整，只有一部分。我也在網(wǎng)上查了一些原因，總結(jié)下來(lái)。

為什么有時(shí)看不到已經(jīng)創(chuàng)建好的表并且查詢結(jié)果一直抖動(dòng)時(shí)多時(shí)少？

常見(jiàn)原因1：

建表流程存在問(wèn)題。ClickHouse的分布式集群搭建并沒(méi)有原生的分布式DDL語(yǔ)義。如果您在自建ClickHouse集群時(shí)使用create table創(chuàng)建表，查詢雖然返回了成功，但實(shí)際這個(gè)表只在當(dāng)前連接的Server上創(chuàng)建了。下次連接重置換一個(gè)Server，您就看不到這個(gè)表了。

解決方案：

建表時(shí)，請(qǐng)使用create table <table_name> on cluster default語(yǔ)句，on cluster default聲明會(huì)把這條語(yǔ)句廣播給default集群的所有節(jié)點(diǎn)進(jìn)行執(zhí)行。示例代碼如下。 Create table test on cluster default (a UInt64) Engine = MergeTree() order by tuple(); 在test表上再創(chuàng)建一個(gè)分布式表引擎，建表語(yǔ)句如下。 Create table test_dis on cluster default as test Engine = Distributed(default, default, test, cityHash64(a));

常見(jiàn)原因2：

ReplicatedMergeTree存儲(chǔ)表配置有問(wèn)題。ReplicatedMergeTree表引擎是對(duì)應(yīng)MergeTree表引擎的主備同步增強(qiáng)版，在單副本實(shí)例上限定只能創(chuàng)建MergeTree表引擎，在雙副本實(shí)例上只能創(chuàng)建ReplicatedMergeTree表引擎。

解決方案：

在雙副本實(shí)例上建表時(shí)，請(qǐng)使用ReplicatedMergeTree(‘/clickhouse/tables/{database}/{table}/{shard}’, ‘{replica}’)或ReplicatedMergeTree()配置ReplicatedMergeTree表引擎。其中，ReplicatedMergeTree(‘/clickhouse/tables/{database}/{table}/{shard}’, ‘{replica}’)為固定配置，無(wú)需修改。

這里引出了復(fù)制表的概念，這里介紹一下，只有 MergeTree 系列里的表可支持副本：

ReplicatedMergeTree

ReplicatedSummingMergeTree

ReplicatedReplacingMergeTree

ReplicatedAggregatingMergeTree ReplicatedCollapsingMergeTree

ReplicatedVersionedCollapsingMergeTree

ReplicatedGraphiteMergeTree

副本是表級(jí)別的，不是整個(gè)服務(wù)器級(jí)的。所以，服務(wù)器里可以同時(shí)有復(fù)制表和非復(fù)制表。副本不依賴分片。每個(gè)分片有它自己的獨(dú)立副本。

創(chuàng)建復(fù)制表

先做好準(zhǔn)備工作，該建表的建表，然后編寫(xiě)程序。在表引擎名稱上加上 Replicated 前綴。例如：ReplicatedMergeTree。

首先創(chuàng)建一個(gè)分布式數(shù)據(jù)庫(kù)

create database test on cluster default_cluster;

創(chuàng)建本地表

由于clickhouse是分布式的，創(chuàng)建本地表本來(lái)應(yīng)該在每個(gè)節(jié)點(diǎn)上創(chuàng)建的，但是指定on cluster關(guān)鍵字可以直接完成，建表語(yǔ)句如下：

CREATE TABLE test.test_data_shade on cluster default_cluster
(
    `data` Map(String, String),
    `uid` String,
    `remote_addr` String,
    `time` Datetime64,
    `status` Int32,
    ...其它字段省略
    `dt` String
)
ENGINE = ReplicatedMergeTree()
partition by dt
order by (dt, sipHash64(uid));

這里表引擎為ReplicatedMergeTree，即有副本的表，根據(jù)dt按天分區(qū)，提升查詢效率，sipHash64是一個(gè)hash函數(shù)，根據(jù)uid散列使得相同uid數(shù)據(jù)在同一個(gè)分片上面，如果有去重需求，速度更快，因?yàn)榭梢杂?jì)算每個(gè)分片去重，再匯總一下即可。

創(chuàng)建分布式表

CREATE TABLE test.test_data_all on cluster default_cluster as test.test_data_shade ENGINE = Distributed('default_cluster', 'test', 'test_data_shade', sipHash64(uid));

在多副本分布式 ClickHouse 集群中，通常需要使用 Distributed 表寫(xiě)入或讀取數(shù)據(jù)，Distributed 表引擎自身不存儲(chǔ)任何數(shù)據(jù)，它能夠作為分布式表的一層透明代理，在集群內(nèi)部自動(dòng)開(kāi)展數(shù)據(jù)的寫(xiě)入、分發(fā)、查詢、路由等工作。

通過(guò)jdbc寫(xiě)入

這個(gè)我是看的官方文檔，里面有2種選擇，感興趣的同學(xué)可以都去嘗試一下。

這里貼一下我的Pom依賴

<dependency>
    <groupId>ru.yandex.clickhouse</groupId>
    <artifactId>clickhouse-jdbc</artifactId>
    <version>0.3.1-patch</version>
    <classifier>shaded</classifier>
    <exclusions>
        <exclusion>
            <groupId>*</groupId>
            <artifactId>*</artifactId>
        </exclusion>
    </exclusions>
</dependency>

Flink主程序，消費(fèi)kafka，做清洗，然后寫(xiě)入clickhouse，這都是常規(guī)操作，這里貼一下關(guān)鍵代碼吧。

連接clickhouse有2種方式，8123端口的http方式，和基于9000端口的tcp方式。

這里官方推薦的是連接驅(qū)動(dòng)是0.3.2：

<dependency>
    <!-- please stop using ru.yandex.clickhouse as it's been deprecated -->
    <groupId>com.clickhouse</groupId>
    <artifactId>clickhouse-jdbc</artifactId>
    <version>0.3.2-patch11</version>
    <classifier>all</classifier>
    <exclusions>
        <exclusion>
            <groupId>*</groupId>
            <artifactId>*</artifactId>
        </exclusion>
    </exclusions>
</dependency>