发明名称 一种数据去重的方法及装置
摘要 本发明公开了一种数据去重的方法及装置,该方法包括:获取待处理的数据的业务主键,所述业务主键为根据业务需求代表数据唯一性的字段;将所述业务主键转换为统一的预设格式,生成匹配码;按预设的顺序对所述生成的匹配码进行排序,生成验证码;查找所述经排序后的验证码,将所述验证码与排列在前的第一验证码进行比对,当所述验证码与所述第一验证码相同时,将所述验证码的区分码记为第二区分码;删除所述验证码中标记为第二区分码的数据。在对多行或者多列且数据规模在千万级以上的数据进行处理时,该去重方法配置简单、使用方便、可操作性强,并且能够实现多行或多列的同时去重处理,节省了大量的处理时间,提高了去重处理的效率。
申请公布号 CN104462527A 申请公布日期 2015.03.25
申请号 CN201410811756.4 申请日期 2014.12.22
申请人 龙信数据(北京)有限公司 发明人 马欣;顾喜德
分类号 G06F17/30(2006.01)I 主分类号 G06F17/30(2006.01)I
代理机构 北京集佳知识产权代理有限公司 11227 代理人 王宝筠
主权项 一种数据去重的方法,其特征在于,包括:获取待处理的数据的业务主键,所述业务主键为根据业务需求代表数据唯一性的字段;将所述业务主键转换为统一的预设格式,生成匹配码;按预设的顺序对所述生成的匹配码进行排序,生成验证码;查找所述经排序后的验证码,将所述验证码与排列在前的第一验证码进行比对,当所述验证码与所述第一验证码相同时,将所述验证码的区分码记为第二区分码;删除所述验证码中标记为第二区分码的数据。
地址 100097 北京市海淀区蓝靛厂东路2号金源时代商务中心B座3D