看过本文的还看了

相关文献

该作者的其他文献

文献详情 >Hadoop集群中影响应用性能的因素分析 收藏
Hadoop集群中影响应用性能的因素分析

Hadoop集群中影响应用性能的因素分析

作     者:马生俊 陈旺虎 郭宏乐 乔保民 李新田 MA Sheng-jun, CHEN Wang-hu, GUO Hong-le, QIAO Bao-min, LI Xin-tian

作者机构:西北师范大学计算机科学与工程学院兰州730070 

基  金:国家自然科学基金项目(61462076)资助 

出 版 物:《小型微型计算机系统》 (Journal of Chinese Computer Systems)

年 卷 期:2018年第39卷第4期

页      码:719-724页

摘      要:针对Hadoop集群中应用执行的低效率、高成本问题,首先,通过对Hadoop分布式存储技术和并行编程模型的分析,发现数据集采用单文件还是多文件方式,以及数据块划分的大小是影响其性能的主要因素.其次,设计实验探讨了不同规模集群环境下,两类数据集以及不同大小的数据块对应用性能的影响程度.最后,综合实验结果发现,在数据量一定的情况下,随着数据块的增大,map任务数的变化导致大文件数据集的执行效率越来越高于小文件数据集的执行效率;另外,两类数据集在小规模集群(1个Slave)上的执行效率大约均是大规模集群(10个Slave)下的2倍.故此,在Hadoop集群环境中为了提高应用性能,应通过增大数据块等方法来减少map任务数,而不应盲目增大集群规模.该结论可对Hadoop集群环境下应用效率的优化提供参考.

主 题 词:Hadoop集群 性能 集群规模 数据块 数据集类型 因素分析 

学科分类:08[工学] 081202[081202] 0812[工学-测绘类] 

D O I:10.3969/j.issn.1000-1220.2018.04.018

馆 藏 号:203286387...

读者评论 与其他读者分享你的观点

用户名:未登录
我的评分