看过本文的还看了

相关文献

该作者的其他文献

文献详情 >基于大数据计算框架的分布式新闻聚类系统设计 收藏
基于大数据计算框架的分布式新闻聚类系统设计

基于大数据计算框架的分布式新闻聚类系统设计

作     者:卢献华 王洪俊 LU Xian-hua;WANG Hong-jun

作者机构:北京信息科技大学北京100101 北京拓尔思信息技术股份有限公司北京100101 

出 版 物:《计算机科学》 (Computer Science)

年 卷 期:2019年第46卷第S11期

页      码:220-223页

摘      要:对海量的互联网新闻进行快速热点聚类是一个重要的研究方向。针对大规模文本聚类的几个关键问题(相似度计算、分布式聚类、聚类结果概要生成),文中设计并实现了一个基于Spark计算框架的分布式新闻聚类系统。该系统采用GPU加速的深度相似度算法进行新闻文本的相似度计算,得到新闻之间的相似关系,并采用图聚类算法进行新闻聚类,最后采用标题压缩技术形成热点描述,生成最终的聚类结果。实验结果证明,文中提出的系统具有较高的执行效率和良好的可扩展性,可以有效地处理大规模新闻的热点聚类任务。

主 题 词:分布式图聚类 深度相似度计算 GPU加速 标题压缩 大数据 

学科分类:08[工学] 0812[工学-测绘类] 

馆 藏 号:203828426...

读者评论 与其他读者分享你的观点

用户名:未登录
我的评分