看过本文的还看了

相关文献

该作者的其他文献

文献详情 >基于最大频繁等价类的Web信息自动抽取 收藏
基于最大频繁等价类的Web信息自动抽取

基于最大频繁等价类的Web信息自动抽取

作     者:陈华昌 薛永生 任仲晟 张东站 CHEN Hua-Chang;XUE Yong-Sheng;REN Zhong-Sheng;ZGANG Dong-Zhan

作者机构:厦门大学计算机科学系 福建生态工程职业技术学校福州350008 

基  金:国家自然科学基金(50474033) 福建省自然科学基金(A0310008) 福建省重点科技项目(2003H043) 

出 版 物:《计算机科学》 (Computer Science)

年 卷 期:2006年第33卷第12期

页      码:169-173,202页

摘      要:在定义模板的基础上,提出了页面创建模型。该模型描述了如何使用模板将来自于后台数据库的值编码生成页面。基于这个模型,设计了一个基于最大频繁等价类的抽取算法EBMFEC,通过分析给定的数据导向型页面的终端符号的出现情况,找出最大频繁等价类,并推导出用于生成页面的未知模板。然后使用推导出的模板,从输入页面中提取出相关信息。在大量实际HTML页面上的实验证明,EBMFEC在大部分情况下都可以从给定页面中推导出模板,并正确抽取出数据信息。

主 题 词:等价类 信息抽取 模式 模板 

学科分类:081203[081203] 08[工学] 0835[0835] 0812[工学-测绘类] 

核心收录:

D O I:10.3969/j.issn.1002-137X.2006.12.046

馆 藏 号:203132123...

读者评论 与其他读者分享你的观点

用户名:未登录
我的评分