看过本文的还看了

相关文献

该作者的其他文献

文献详情 >基于Python的改进关键词提取算法的实现 收藏
基于Python的改进关键词提取算法的实现

基于Python的改进关键词提取算法的实现

作     者:牛永洁 NIU Yong-jie

作者机构:延安大学数学与计算机学院 

基  金:国家社会科学基金项目(18BTQ042) 延安大学继续教育教学改革研究专项(YDJY2016-11) 

出 版 物:《电子设计工程》 (Electronic Design Engineering)

年 卷 期:2019年第27卷第13期

页      码:11-15页

摘      要:关键词提取是自然语言研究领域的基础和关键点,在很多领域都有广泛的应用。以本校图书馆提供的8045篇《红色中华》新闻为源数据,首先对数据进行数据清理,去除其中的噪声数据,然后对每篇新闻进行数据结构解析,在解析的基础上计算了词语的TFIDF权重、词位置权重、词性权重、词长权重和词跨度权重,综合考虑这些权重计算出词语的综合权重,以综合权重最大的前8个词语作为新闻的关键词。从准确度、召回率及F1值3个指标对改进算法、经典的TFIDF算法和专家标注进行对比,发现改进算法在3个指标上均优于经典的TFIDF算法,与专家标注比较接近,值得推广应用。

主 题 词:TFIDF 词性 词跨度 词长 词位置 

学科分类:08[工学] 0835[0835] 081202[081202] 0812[工学-测绘类] 

D O I:10.3969/j.issn.1674-6236.2019.13.003

馆 藏 号:203692794...

读者评论 与其他读者分享你的观点

用户名:未登录
我的评分