大家好,我是方木
点击关注公众号,Java干货及时送达
前言
想必做过商品服务都是将商品相关的信息和价格保存在数据库中,例如 MySql
,当有商品的信息和价格一条数据新增或修改需要马上将数据同步到 kafka 中或其他的数据库中,这时候就需要借助阿里开源出来的 Canal
来实现我们功能。
什么是 canal
❝官方描述:canal,译意为水道/管道/沟渠,主要用途是基于 「MySQL 数据库增量日志解析」,提供「增量数据订阅和消费」。
❞
简单理解 canal
主要是针对 MySQL
「增量数据同步工具」,将实时数据同步到 Mysql
、Kafka
、Elasticsearch
、Hbase
、RocketMQ
、Pulsar
等

canal 使用场景
数据库镜像 数据库实时备份 索引构建和实时维护(拆分异构索引、倒排索引等) 业务 cache
刷新带业务逻辑的增量数据处理
注意: 当前 Canal 支持的 MySQL 版本有 5.1.x
, 5.5.x
, 5.6.x
, 5.7.x
, 8.0.x
canal 工作原理
了解 canal 工作原理前,我们需要想知道 「MySQL 主备复制原理」

MySQL master
将数据变更写入二进制日志(binary log
, 其中记录叫做二进制日志事件binary log events
,可以通过show binlog events
进行查看)MySQL slave
将master
的binary log events
拷贝到它的中继日志(relay log
)MySQL slave
重放relay log
中事件,将数据变更反映它自己的数据
「canal 工作原理」也就是基于「MySQL 主备复制原理」,因此也就相对比较简单:
canal 模拟 mysql slave
的交互协议,伪装自己为mysql slave
,向mysql master
发送dump
协议mysql master
收到dump
请求,开始推送binary log
给slave
(也就是 canal)canal 解析 binary log
对象(原始为byte
流)
canal 架构
❝1.1.4 canal 整体架构,主要包括 admin模块、server模块、instance模块、client-adapter模块、RDS、zk、消息中间件等
❞

「说明:」
「canal-admin」:设计上是为 canal
提供整体配置管理、节点运维等面向运维的功能,提供相对友好的WebUI
操作界面,方便更多用户快速和安全的操作「canal-server cluster」:同一个集群中的多台 canal-server
,一个集群中有多个instance
实例任务,每个instance
实例通过zookeeper
在集群中实现高可用,一般我们是通过2台canal-server
组成集群模式「canal-server」:一个 canal-server
里可以运行多个instance
实例任务「instance」:一个实际运行订阅 mysql
的数据队列(核心模块),包括了EventPaser
、EventSink
、EventStore
等组件「canal-client」:用于消费 instance
订阅mysql
的数据队列,RocketMQ 投递的方式是一样的(内嵌 client 将消费到的数据直接投递到 RocketMQ中,业务开发只需要订阅 RocketMQ 消息即可)。不管是内嵌 client 的方式,还是 canal-client 的方式都是 基于Mysql 的 Slave 协议实时 dump binlog 流,解析为事件发送给订阅方。数据对象格式:EntryProtocol.proto
Entry
Header
logfileName [binlog文件名]
logfileOffset [binlog position]
executeTime [binlog里记录变更发生的时间戳]
schemaName [数据库实例]
tableName [表名]
eventType [insert/update/delete类型]
entryType [事务头BEGIN/事务尾END/数据ROWDATA]
storeValue [byte数据,可展开,对应的类型为RowChange]
RowChange
isDdl [是否是ddl变更操作,比如create table/drop table]
sql [具体的ddl sql]
rowDatas [具体insert/update/delete的变更数据,可为多条,1个binlog event事件可对应多条变更,比如批处理]
beforeColumns [Column类型的数组]
afterColumns [Column类型的数组]
Column
index [column序号]
sqlType [jdbc type]
name [column name]
isKey [是否为主键]
updated [是否发生过变更]
isNull [值是否为null]
value [具体的内容,注意为文本]复制
说明:
可以提供数据库变更前和变更后的字段内容,针对binlog中没有的name,isKey等信息进行补全 可以提供ddl的变更语句

「说明:」
server
代表一个canal
运行实例,对应于一个jvm
instance
对应于一个数据队列 (1个server
对应1..n个instance
)
「instance模块:」
「eventParser」 :数据源接入,模拟 slave
协议和master
进行交互:dump binlog、协议解析「eventSink」 : Parser
和Store
链接器,进行数据过滤,加工,分发的工作「eventStore」 :存储 sink
模块处理后的数据「metaManager」 :增量订阅&消费信息管理器
知识科普 -- MySQL 的 Binary Log 简介
❝Mysql 官方 The Binary Log 详细介绍
❞
mysql
的binlog
是多文件存储,定位一个LogEvent
需要通过binlog filename + binlog position
,进行定位mysql
的binlog
数据格式,按照生成的方式,主要分为:statement-based
、row-based
、mixed
。
mysql> show variables like 'binlog_format';
+---------------+-------+
| Variable_name | Value |
+---------------+-------+
| binlog_format | ROW |
+---------------+-------+
1 row in set (0.00 sec)复制
「binlog 结构解析图」

想必现在大家也算是对 canal 已经有了大致的了解,后续方木会带着大家 手把手地搭建整套 canal 集群:canal+zookeeper+kafka+mysql