发明名称 |
一种版面信息识别的方法及装置 |
摘要 |
本发明提供一种版面信息识别方法,包括:读取待识别版面,分离字符文本对象与图像对象,合并文本块,将图像对象保留为图像块;从合并的文本块中识别出图注文本块;利用优化方法对图像块和图注文本块进行最优匹配,从而获得相关联的图像块与图注文本块;从所述版面的文本块中去掉图注文本块,并确定其余文本块和图像块的阅读顺序;在阅读顺序中将图注文本块插回到相关联的图像块之后。相应地,本发明提供一种版面信息识别装置。本发明将版面上的全部图像和图注综合考虑,通过最优匹配方法获得图像与图注的全局最优匹配,不受图像与图注数目以及它们之间空间样式的限制,能够从全局上找到最优的关联关系,从而改进现有的版面阅读顺序识别效果。 |
申请公布号 |
CN102262618A |
申请公布日期 |
2011.11.30 |
申请号 |
CN201010193898.0 |
申请日期 |
2010.05.28 |
申请人 |
北京大学;北大方正集团有限公司;北京北大方正技术研究院有限公司 |
发明人 |
高良才;汤帜;房婧;仇睿恒 |
分类号 |
G06F17/22(2006.01)I;G06F17/27(2006.01)I |
主分类号 |
G06F17/22(2006.01)I |
代理机构 |
北京天昊联合知识产权代理有限公司 11112 |
代理人 |
陈源;罗建民 |
主权项 |
一种改进版面阅读顺序识别效果的方法,包括以下步骤:读取待识别版面,分离该版面中的字符文本对象与图像对象,并将字符文本对象合并成文本块,将图像对象保留为图像块;从合并的文本块中识别出图注文本块;利用优化方法对图像块和图注文本块进行最优匹配,从而获得相关联的图像块与图注文本块;从所述版面的文本块中去掉图注文本块,并确定其余文本块和图像块的阅读顺序;在阅读顺序中将图注文本块插回到相关联的图像块之后。 |
地址 |
100871 北京市海淀区颐和园路5号 |