一种周期性MapReduce作业的负载均衡策略

被引:15
作者
傅杰
都志辉
机构
[1] 清华大学计算机科学与技术系
关键词
MapReduce; TeraSort; 负载均衡; 周期性;
D O I
暂无
中图分类号
TP301.6 [算法理论];
学科分类号
摘要
MapReduce任务负载均衡主要是通过分区函数来实现的,Hadoop默认的分区函数并不能很好地保证redu-cer的负载均衡。针对周期性的业务处理提出了一种基于权重计算的负载均衡策略,周期性任务的数据分布与历史数据相比具有相似性。本策略根据历史数据运行的信息运算出数据权重信息(文中用权重表示每条记录的处理复杂度),再通过Map阶段抽样分析当前这批数据的分布特征来预测待处理数据带权重的整体近似分布情况,从而指导Reduce分区,以保证其负载均衡。通过简单的例子仿真了整个策略的运作过程,并且对比了与TeraSort思路的不同点。最后通过分析用户访问视频的日志证明了文中提到的策略比默认的策略性能提高了接近1倍。
引用
收藏
页码:38 / 40
页数:3
相关论文
共 1 条
[1]  
The performance of MapReduce: an in-depthstudy .2 JIANG D,OOI B C,SHI L,et al. Proceedings of the VLDB Endowment . 2010