数仓知识07：数据增量更新的几种方式

3年前 (2022) 程序员胖胖胖虎阿

267 0 0

增量更新的本质，其实是获取源表中数据变化的情况（增、删、改），然后将源表中发生的变化同步至目标表中。

不同的方式，获取源表中数据变化的情况不一样，受技术的限制、表结构的限制，某些方式可能无法获取到完整的数据变化情况，因此只能适用于特定的场景。

方式

简述

适用场景

详述

优点

缺点

时间戳增量1

记录每次读数完成时的最大时间戳，后续读数时只获取源头表中新增的数据，将其增量写入到目标表。

性能好

时间戳增量2

通过时间戳获取源头表新增和修改的数据，然后将其写入到目标表。

增量抽取时，抽取进程通过比较上次存档的时间与抽取源表的时间戳字段的值来决定抽取哪些数据。这种方式需要在源表上增加一个时间戳字段，系统中更新修改表数据的时候，同时修改时间戳字段的值。
有的数据库(例如Sql Server)的时间戳支持自动更新，即表的其它字段的数据发生改变时，时间戳字段的值会被自动更新为记录改变的时刻。在这种情况下，进行ETL实施时就只需要在源表加上时间戳字段就可以了。对于不支持时间戳自动更新的数据库，这就要求业务系统在更新业务数据时，通过编程的方式手工更新时间戳字段。
使用时间戳方式可以正常捕获源表的插入和更新操作，但对于删除操作则无能为力，需要结合其它机制才能完成。

性能尚可，能够获取改动的源头数据

触发器

为抽取的表建立触发器，一般要建立插入、修改、删除三个触发器，源头表的数据发生变化时，触发器将变化的数据写入临时表，抽取线程再从临时表中抽取数据。

所有场景

该方式是根据抽取要求，在要被抽取的源表上建立插入、修改、删除3个触发器，每当源表中的数据发生变化，就被相应的触发器将变化的数据写入一个增量日志表，ETL的增量抽取则是从增量日志表中而不是直接在源表中抽取数据，同时增量日志表中抽取过的数据要及时被标记或删除。
为了简单起见，增量日志表一般不存储增量数据的所有字段信息，而只是存储源表名称、更新的关键字值和更新操作类型(insert、update或delete)，ETL增量抽取进程首先根据源表名称和更新的关键字值，从源表中提取对应的完整记录，再根据更新操作类型，对目标表进行相应的处理。

性能好

覆盖场景全面

成本高，需要建触发器

全表对比（MD5）

为源头表建立一个结构类似的MD5临时表，每次抽数时对源头表和MD5临时表进行MD5校验码比对，从而决定源头表中的数据是新增、修改还是删除，同时更新MD5校验码。

所有场景

全表比对即在增量抽取时，ETL进程逐条比较源表和目标表的记录，将新增和修改的记录读取出来。
优化之后的全表比对方式是采用MD5校验码，需要事先为要抽取的表建立一个结构类似的MD5临时表，该临时表记录源表的主键值以及根据源表所有字段的数据计算出来的MD5校验码，每次进行数据抽取时，对源表和MD5临时表进行MD5校验码的比对，如有不同，进行update操作：如目标表没有存在该主键值，表示该记录还没有，则进行insert操作。然后，还需要对在源表中已不存在而目标表仍保留的主键值，执行delete操作。

覆盖场景全面

需要全表对比，性能差

全表对比（指定字段）

对比目标表和源头表的几个关键字段，获取源头表和目标表不一致的数据，然后增量写入到目标库。

所有场景