9月4号下午,新学年的第二期博士沙龙在实验室210学术报告厅举行。此次沙龙的主题为MapReduce编程模型的设计、实现以及应用,由博士生程斌主讲。
金老师就Map和Reduce任务的处理顺序、是否可以流水线处理等问题提出了看法,并鼓励大家快速跟进最前沿的研究成果,以此促进自身的研究课题。参加沙龙的有实验室老师、博士研究生和华为公司的几位研究人员。
新学年的博士沙龙更加注重分析和学习国际上相关领域的最新研究成果。金老师将当前国际上最活跃的研究课题与实验室的研究方向相结合给出沙龙议题,由博士生进行相关调研,最后由一名博士生负责在沙龙上主讲,师生共同讨论。通过这种形式的交流,不仅可以让同学们高效快速地接触到最前沿的研究内容,而且能够让大家掌握新的知识和研究方法,这对我们的研究工作是有益的补充。
MapReduce是Google公司2004年在OSDI国际会议上提出的一种针对大规模数据处理的分布式编程模型,它将大规模数据的分布式处理程序抽象成为一个运行平台和两个用户自定义的函数:Map和Reduce。Map函数负责处理子数据集并产生中间结果,Reduce函数负责对中间结果进行归约并生成最终的处理结果,运行平台则负责Map和Reduce任务的调度、容错以及数据的管理等。
MapReduce的出现极大程度地简化了编写处理大规模数据的分布式程序的难度,使用户可以在不用关心底层细节的情况下完成数据处理任务并拿到所需的结果。MapReduce的主要应用包括大规模数据排序、网页内容分析处理、日志数据挖掘等。目前基于大规模集群环境的MapReduce框架的实现主要有2种:Google基于C++实现的MapReduce和Yahoo基于Java实现的Hadoop。作为开源项目,Hadoop为我们了解和使用MapReduce编程框架提供了可借鉴的平台。
通讯员: 程斌