赞
踩
数据抽取 是指从源数据源系统抽取需要的数据。实际应用中,数据源较多采用的是关系数据库。总体而言,数据抽取的常见方法有两大类,一是基于查询式的,一是基于日志的。
基于查询式的数据抽取,顾名思义,以从来源库来源表查询数据为主。总体又有几种:触发器方式,增量字段方式,时间戳方式等等。
在要抽取的表上建立需要的触发器,一般要建立插入、修改、删除三个触发器,每当源表中的数据发生变化,就被相应的触发器将变化的数据写入一个临时表,抽取线程从临时表中抽取数据,临时表中抽取过的数据 被标记或删除。
它是一种基于快照比较的变化数据捕获方式,在源表上含有一个增量字段,系统中更新修改表数据的时候,同时修改增量字段的值。当进行数据抽取时,通过比较上次抽取时记录的增量字段值来决定抽取哪些数据。严格意义上讲,增量字段要求必须递增且唯一。
delete
和 update
操作,在数据准确性上受到了一定的限制。无法获取 delete
及分别出 insert
和 update
。放宽松条件的增量字段方式,不要求字段唯一,满足递增即可。在源表上含有一个 时间戳字段,系统中更新修改表数据的时候,同时修改增量字段的值。当进行数据抽取时,通过比较上次抽取时间与时间戳字段的值来决定抽取哪些数据。有的数据库的时间戳支持自动更新,即表的其它字段的数据发生改变时,自动更新时间戳字段的值。有的数据库不支持时间戳的自动更新,这就要求业务系统在更新业务数据时,手工更新时间戳字段。
delete
和 update
操作,在数据准确性上受到了一定的限制。在一次抽取过程中如果数据量大,时间戳字段相同值较多,分页查询抽取时可能会丢失数据(order by
顺序不定导致)。每次 ETL 操作均删除目标表数据,由 ETL 全新加载数据。
数据库通常借助日志来实现事务,常见的有 undo log
、redo log
。undo log
/ redo log
都能保证事务特性,这里主要是原子性和持久性,即事务相关的操作,要么全做,要么不做,并且修改的数据能得到持久化。
我们通过采集日志把已经 commit
的事务数据抽取出来,对于没有 commit
的事务不做操作,进而达到数据抽取的目的。
insert
/ update
/ delete
),支持事务。比如说常见的 MySQL 的 binlog
日志同步,Oracle 使用自带的 LogMiner
工具解析归档日志等等。
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。