发明名称 |
一种文本数据挖掘方法 |
摘要 |
本发明公开了一种文本数据挖掘方法。包括步骤:读取包含有至少一个模板变量规则的预制模板文件;根据所述模板变量规则,将所述模板文件编译为由正则表达式构成的模板对象;根据所述模板对象,扫描待挖掘的文本数据,对其进行数据匹配;根据所述正则表达式,将所述文本数据中匹配的原始信息顺序提取出来;以及根据所述模板变量规则,将所述提取出来的原始信息解析为指定数据名与数据类型的数据值。按照本发明,对不同格式的文本数据只需通过修改模板文件就可以对其进行分析处理,而不需要依靠开发程序代码或使用昂贵的商业化数据挖掘工具,从而降低了电信网管系统的复杂性和成本。 |
申请公布号 |
CN101151843B |
申请公布日期 |
2010.05.12 |
申请号 |
CN200580049341.7 |
申请日期 |
2005.06.22 |
申请人 |
中兴通讯股份有限公司 |
发明人 |
李进;李小进;邓朝明;唐文彬;郭梅彭;向梅 |
分类号 |
H04L12/26(2006.01)I;G06F17/00(2006.01)I |
主分类号 |
H04L12/26(2006.01)I |
代理机构 |
北京安信方达知识产权代理有限公司 11262 |
代理人 |
霍育栋;王漪 |
主权项 |
一种文本数据挖掘方法,其特征在于包括如下步骤:读取包含有至少一个模板变量规则的预制模板文件;根据所述模板变量规则,将所述模板文件编译为由正则表达式构成的模板对象;根据所述模板对象,扫描待挖掘的文本数据,对其进行数据匹配;根据所述正则表达式,将所述文本数据中匹配的原始信息顺序提取出来;以及根据所述模板变量规则,将所述提取出来的原始信息解析为指定数据名与数据类型的数据值。 |
地址 |
518000 广东省深圳市南山区高新技术产业园科技南路中兴通讯大厦 |