发明名称 | 文档处理方法和系统 | ||
摘要 | 本发明涉及文档处理技术,更具体地,涉及在企业搜索领域扩展作为搜索数据源的文档集的方法和系统。本发明提供一种对种子文档集中的种子文档进行扩展的方法,其中所述种子文档集包括至少一篇种子文档,所述方法包括:识别所述种子文档的一个或多个实体词,所述实体词是表示所述种子文档所关注的实体的词;依据所识别的每个实体词,识别该实体词所在的种子文档的一个或多个与所依据的该实体词相关的主题词;将所识别的每个主题词以及识别所述每个主题词时所依据的实体词组成实体词-主题词对;将每个所述实体词-主题词对中的实体词和主题词同时作为关键词,通过网络获得一篇或多篇扩展文档。 | ||
申请公布号 | CN101901235B | 申请公布日期 | 2013.03.27 |
申请号 | CN200910203108.X | 申请日期 | 2009.05.27 |
申请人 | 国际商业机器公司 | 发明人 | 崔洁;包胜华;张俐;苏辉;苏中 |
分类号 | G06F17/30(2006.01)I | 主分类号 | G06F17/30(2006.01)I |
代理机构 | 北京市金杜律师事务所 11256 | 代理人 | 王茂华;李辉 |
主权项 | 一种对种子文档集中的种子文档进行扩展的方法,其中所述种子文档集包括至少一篇种子文档,所述方法包括:识别所述种子文档的一个或多个实体词,所述实体词是表示所述种子文档所关注的实体的词;依据所识别的每个实体词,识别该实体词所在的种子文档的一个或多个与所依据的该实体词相关的主题词;将所识别的每个主题词,以及识别所述每个主题词时所依据的实体词组成实体词‑主题词对;以及将每个所述实体词‑主题词对中的实体词和主题词同时作为关键词,通过网络获得一篇或多篇扩展文档,所述扩展文档既包含所述每个实体词‑主题词对中的实体词,也包含所述每个实体词‑主题词对中的主题词。 | ||
地址 | 美国纽约阿芒克 |