发明名称 |
分词方法及装置 |
摘要 |
本发明实施例公开了一种分词方法及装置,属于数据处理领域。其中所述方法包括:获取一段时间内词在不同搜索领域中被搜索的次数,根据被搜索的次数计算出词的统计分数;根据词的长度计算出词的长度分数;根据词的统计分数和长度分数得到词的分值,由词和词的分值生成分词词典;获取待分词的句子,将待分词的句子与分词词典中的词进行匹配以得到多个分词结果,计算各个分词结果的分值,将分值高的分词结果作为待分词的句子的分词结果。本发明通过采用对海量用户的搜索行为进行统计并建立精准的分词词典进行分词的方式,从而能够快速、准确地对句子进行分词。 |
申请公布号 |
CN104462051A |
申请公布日期 |
2015.03.25 |
申请号 |
CN201310415761.9 |
申请日期 |
2013.09.12 |
申请人 |
腾讯科技(深圳)有限公司 |
发明人 |
程刚 |
分类号 |
G06F17/27(2006.01)I;G06F17/30(2006.01)I |
主分类号 |
G06F17/27(2006.01)I |
代理机构 |
上海波拓知识产权代理有限公司 31264 |
代理人 |
王春丽 |
主权项 |
一种分词方法,其特征在于,所述分词方法包括:获取一段时间内词在不同搜索领域中被搜索的次数,根据所述被搜索的次数计算出词的统计分数;根据词的长度计算出词的长度分数;根据所述词的统计分数和所述长度分数得到词的分值,由词和词的分值生成分词词典;获取待分词的句子,将所述待分词的句子与所述分词词典中的词进行匹配以得到多个分词结果,计算各个分词结果的分值,将分值高的分词结果作为所述待分词的句子的分词结果。 |
地址 |
518044 广东省深圳市福田区振兴路赛格科技园2栋东403室 |