发明名称 |
词语识别方法及装置 |
摘要 |
本发明的实施方式提供了一种词语识别方法,包括:对所述词语中的每个单字进行识别,并记录识别结果中置信度最高的前若干个识别的候选字及其对应的置信度;搜索每个常用词的各单字是否在所述词语的单字的候选字中出现,若出现,则记录该单字的在该常用词中的该候选字的置信度,若未出现,则将该字的置信度计为零;计算针对每个常用词的所述词语中各单字的平均置信度,作为该常用词的置信度;若置信度最高的常用词的置信度大于一阈值,则输出这个常用词作为该词语的识别结果,否则输出该词语的每个单字的置信度最高的候选字作为该词语的识别结果。通过使用常用词语的先验知识对词语进行识别,获得整个词语的置信度,降低了单个字识别的误差,提高了词语识别的准确率和效率。 |
申请公布号 |
CN103870822A |
申请公布日期 |
2014.06.18 |
申请号 |
CN201210570618.2 |
申请日期 |
2012.12.17 |
申请人 |
北京千橡网景科技发展有限公司 |
发明人 |
郑大念 |
分类号 |
G06K9/20(2006.01)I |
主分类号 |
G06K9/20(2006.01)I |
代理机构 |
北京市金杜律师事务所 11256 |
代理人 |
酆迅 |
主权项 |
一种词语识别方法,包括:对词语中的每个单字进行识别,并记录识别结果中置信度最高的前若干个识别的候选字及其对应的置信度;搜索每个常用词的各单字是否在所述词语的单字的候选字中出现,若出现,则记录该单字的在该常用词中的该候选字的置信度,若未出现,则将该字的置信度计为零;计算针对每个常用词的所述词语中各单字的平均置信度,作为该常用词的置信度;若置信度最高的常用词的置信度大于一阈值,则输出这个常用词作为该词语的识别结果,否则输出该词语的每个单字的置信度最高的候选字作为该词语的识别结果。 |
地址 |
100041 北京市石景山区实兴东街11号北楼B1011室 |