发明名称 |
判断网页类型的方法和装置 |
摘要 |
公开了一种判断网页的网页类型的方法和装置。所述方法包括:基于待判断网页的URL,在预先存储的规则列表中进行规则匹配,其中规则列表包括多条用于确定网页类型的规则记录;如果规则匹配成功,则依据成功匹配的规则得到待判断网页的网页类型;如果规则匹配失败,则从待判断网页的URL和/或HTML源代码中提取预定特征,并基于由从提取的预定特征中选择的特征构成的特征向量,使用分类器对待判断网页进行网页类型分类,以得到待判断网页的网页类型。在根据本发明的方案中,能够融合规则识别方案与基于统计学的识别方案的优点,并且能够实现对包括博客、论坛、新闻等在内的各种网页类型进行判断。 |
申请公布号 |
CN101872347B |
申请公布日期 |
2012.09.26 |
申请号 |
CN200910133695.X |
申请日期 |
2009.04.22 |
申请人 |
富士通株式会社 |
发明人 |
何楠;王主龙;于浩 |
分类号 |
G06F17/30(2006.01)I;G06K9/62(2006.01)I |
主分类号 |
G06F17/30(2006.01)I |
代理机构 |
北京集佳知识产权代理有限公司 11227 |
代理人 |
陈炜;李春晖 |
主权项 |
一种用于判断网页的网页类型的方法,包括:基于待判断网页的统一资源定位符URL,在预先存储的规则列表中执行规则匹配,其中规则列表包括多条用于确定网页类型的规则记录;如果规则匹配成功,则依据成功匹配的规则得到待判断网页的网页类型;以及如果规则匹配失败,则从待判断网页的URL和/或超文本标记语言HTML源代码中提取预定特征,并基于由从提取的预定特征中选择的特征构成的特征向量,使用分类器对待判断网页执行网页类型分类,以得到待判断网页的网页类型。 |
地址 |
日本神奈川县 |