赞
踩
我们公司有个项目的数据量高达五千万,但是因为报表那块数据不太准确,业务库和报表库又是跨库操作,所以并不能使用 SQL 来进行同步。当时的打算是通过 mysqldump
或者存储的方式来进行同步,但是尝试后发现这些方案都不切实际:
mysqldump
:不仅备份需要时间,同步也需要时间,而且在备份的过程,可能还会有数据产出(也就是说同步等于没同步)
存储方式:这个效率太慢了,要是数据量少还好,我们使用这个方式的时候,三个小时才同步两千条数据…
后面在网上查看后,发现 DataX 这个工具用来同步不仅速度快,而且同步的数据量基本上也相差无几。
DataX 是阿里云 DataWorks 数据集成 的开源版本,主要就是用于实现数据间的离线同步。 DataX 致力于实现包括关系型数据库(MySQL、Oracle 等)、HDFS、Hive、ODPS、HBase、FTP 等 各种异构数据源(即不同的数据库) 间稳定高效的数据同步功能。
DataX 采用 Framework + Plugin 架构,将数据源读取和写入抽象称为 Reader/Writer 插件,纳入到整个同步框架中。
角色
作用
Reader(采集模块)
负责采集数据源的数据,将数据发送给 Framework
。
Writer(写入模块)
负责不断向 Framework
中取数据,并将数据写入到目的端。
Framework(中间商)
负责连接 Reader
和 Writer
,作为两者的数据传输通道,并处理缓冲,流控,并发,数据转换等核心技术问题。
DataX 完成单个数据同步的作业,我们称为 Job,DataX 接收到一个 Job 后,将启动一个进程来完成整个作业同步过程。DataX Job 模块是单个作业的中枢管理节点,承担了数据清理、子任务切分、TaskGroup 管理等功能。
-->
Channel -->
Writer 线程来完成任务同步工作。DataX 调度过程:
Task / Channel = TaskGroup
,最后由 TaskGroup 根据分配好的并发数来运行 Task(任务)准备工作:
tar
包方式不需要安装)主机名
操作系统
IP 地址
软件包
MySQL-1
CentOS 7.4
192.168.1.1
jdk-8u181-linux-x64.tar.gz
datax.tar.gz
MySQL-2
CentOS 7.4
192.168.1.2
安装 JDK:下载地址(需要创建 Oracle 账号)
[root@MySQL-1 ~]# ls
anaco
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。