发明名称 |
一种网络信息的自动提取方法及装置 |
摘要 |
本发明提供了一种网络信息的自动提取方法及装置,相应的方法包括从给定信息S相关的网页合集W中找到含有给定信息S的子集Ssub中元素的网页W’;根据预定规则生成信息pattern集合P’,并将信息pattern集合P’与正则表达式集合P求合集获得集合P1;将集合P1与给定信息相关的网页合集W中的所有的网页进行匹配,获得集合Ssub’,直到Ssub==Ssub’时抓取过程结束。本发明通过根据不同的网页生成相应的正则表达式集合,实现自动提取网页中的内容,省去了很多工作量。 |
申请公布号 |
CN102855324A |
申请公布日期 |
2013.01.02 |
申请号 |
CN201210335719.1 |
申请日期 |
2012.09.11 |
申请人 |
北京云泓道元信息技术有限公司 |
发明人 |
杨俊拯;温予;张旸;黄百宁;王世平;葛猛;孟玲会 |
分类号 |
G06F17/30(2006.01)I |
主分类号 |
G06F17/30(2006.01)I |
代理机构 |
北京凯特来知识产权代理有限公司 11260 |
代理人 |
郑立明;赵镇勇 |
主权项 |
一种网络信息的自动提取方法,其特征在于,包括:从给定信息S相关的网页合集W中找到含有给定信息S的子集Ssub中元素的网页W’;根据预定规则生成信息pattern集合P’,并将信息pattern集合P’与正则表达式集合P求合集获得集合P1;将集合P1与给定信息相关的网页合集W中的所有的网页进行匹配,获得集合Ssub’,直到Ssub==Ssub′时抓取过程结束。 |
地址 |
100025 北京市朝阳区八里庄东里1号莱锦创意产业园CN02 |