发明名称 |
一种提高版式文档中字符识别率的方法和系统 |
摘要 |
本发明是一种提高版式文档中字符识别率的方法和系统,将所述版式文档中同一个预定字符所对应的字符原始编码与字符标准编码进行比对得到编码比对结果,将多个所述编码比对结果进行概率统计得到概率值,将所述概率值与阈值进行比对,若超过阈值,则所述版式文档显示所述字符原始编码对照通用标准字符编码库得到的字符;否则,所述版式文档显示OCR识别后的字符。本发明通过概率统计的方法,来选择显示所述字符原始编码对照通用标准字符编码库得到的字符或者所述版式文档显示OCR识别后的字符,因此有效提高了字符识别的正确率。 |
申请公布号 |
CN104463153A |
申请公布日期 |
2015.03.25 |
申请号 |
CN201310450972.6 |
申请日期 |
2013.09.25 |
申请人 |
北大方正集团有限公司;北京方正阿帕比技术有限公司 |
发明人 |
董宁;耿蕾蕾 |
分类号 |
G06K9/03(2006.01)I |
主分类号 |
G06K9/03(2006.01)I |
代理机构 |
北京三聚阳光知识产权代理有限公司 11250 |
代理人 |
寇海侠 |
主权项 |
一种提高版式文档中字符识别率的方法,其特征在于,包括如下步骤:将所述版式文档中同一个预定字符所对应的字符原始编码与字符通用标准编码进行比较得到编码相同或者编码不同的编码比对结果;将多个所述预定字符所对应的所述编码比对结果进行概率统计得到所述预定字符采用字符通用标准编码的概率值;将所述概率值与阈值进行比对,若超过阈值,则所述预定字符按照其所述字符原始编码对照通用标准字符编码库所得到的字符并显示;否则,直接显示该所述预定字符通过OCR识别出的字符。 |
地址 |
100871 北京市海淀区成府路298号方正大厦9层 |