发明名称 |
一种数据去重的方法及装置 |
摘要 |
本发明公开了一种数据去重的方法及装置,该方法包括:获取待处理的数据的业务主键,所述业务主键为根据业务需求代表数据唯一性的字段;将所述业务主键转换为统一的预设格式,生成匹配码;按预设的顺序对所述生成的匹配码进行排序,生成验证码;查找所述经排序后的验证码,将所述验证码与排列在前的第一验证码进行比对,当所述验证码与所述第一验证码相同时,将所述验证码的区分码记为第二区分码;删除所述验证码中标记为第二区分码的数据。在对多行或者多列且数据规模在千万级以上的数据进行处理时,该去重方法配置简单、使用方便、可操作性强,并且能够实现多行或多列的同时去重处理,节省了大量的处理时间,提高了去重处理的效率。 |
申请公布号 |
CN104462527A |
申请公布日期 |
2015.03.25 |
申请号 |
CN201410811756.4 |
申请日期 |
2014.12.22 |
申请人 |
龙信数据(北京)有限公司 |
发明人 |
马欣;顾喜德 |
分类号 |
G06F17/30(2006.01)I |
主分类号 |
G06F17/30(2006.01)I |
代理机构 |
北京集佳知识产权代理有限公司 11227 |
代理人 |
王宝筠 |
主权项 |
一种数据去重的方法,其特征在于,包括:获取待处理的数据的业务主键,所述业务主键为根据业务需求代表数据唯一性的字段;将所述业务主键转换为统一的预设格式,生成匹配码;按预设的顺序对所述生成的匹配码进行排序,生成验证码;查找所述经排序后的验证码,将所述验证码与排列在前的第一验证码进行比对,当所述验证码与所述第一验证码相同时,将所述验证码的区分码记为第二区分码;删除所述验证码中标记为第二区分码的数据。 |
地址 |
100097 北京市海淀区蓝靛厂东路2号金源时代商务中心B座3D |