发明名称 判断网页类型的方法和装置
摘要 公开了一种判断网页的网页类型的方法和装置。所述方法包括:基于待判断网页的URL,在预先存储的规则列表中进行规则匹配,其中规则列表包括多条用于确定网页类型的规则记录;如果规则匹配成功,则依据成功匹配的规则得到待判断网页的网页类型;如果规则匹配失败,则从待判断网页的URL和/或HTML源代码中提取预定特征,并基于由从提取的预定特征中选择的特征构成的特征向量,使用分类器对待判断网页进行网页类型分类,以得到待判断网页的网页类型。在根据本发明的方案中,能够融合规则识别方案与基于统计学的识别方案的优点,并且能够实现对包括博客、论坛、新闻等在内的各种网页类型进行判断。
申请公布号 CN101872347B 申请公布日期 2012.09.26
申请号 CN200910133695.X 申请日期 2009.04.22
申请人 富士通株式会社 发明人 何楠;王主龙;于浩
分类号 G06F17/30(2006.01)I;G06K9/62(2006.01)I 主分类号 G06F17/30(2006.01)I
代理机构 北京集佳知识产权代理有限公司 11227 代理人 陈炜;李春晖
主权项 一种用于判断网页的网页类型的方法,包括:基于待判断网页的统一资源定位符URL,在预先存储的规则列表中执行规则匹配,其中规则列表包括多条用于确定网页类型的规则记录;如果规则匹配成功,则依据成功匹配的规则得到待判断网页的网页类型;以及如果规则匹配失败,则从待判断网页的URL和/或超文本标记语言HTML源代码中提取预定特征,并基于由从提取的预定特征中选择的特征构成的特征向量,使用分类器对待判断网页执行网页类型分类,以得到待判断网页的网页类型。
地址 日本神奈川县