当前位置: 开发笔记 > 运维 > 正文

MR总结(三)-MapReduce组件自定义

作者：默一 | 来源：互联网 | 2018-06-12 15:58

自定义InputFormatInputFormat主要包括：?????InputSplit和RecordReader??InputSplit用于定义Map的数目和确定最合适的执行节点（位置）??RecordReader负责从输入文件里读取数据记录，并把数据提交给Mapper处理。?一个自定义分片实现要继承与抽

自定义InputFormat InputFormat主要包括： ? ? ? ? ? InputSplit和RecordReader ? ? InputSplit用于定义Map的数目和确定最合适的执行节点（位置） ? ?RecordReader负责从输入文件里读取数据记录，并把数据提交给Mapper处理。 ? 一个自定义分片实现要继承与抽

自定义InputFormat

InputFormat主要包括：

? ? ? ? ? InputSplit和RecordReader

? ?InputSplit用于定义Map的数目和确定最合适的执行节点（位置）

? ?RecordReader负责从输入文件里读取数据记录，并把数据提交给Mapper处理。

? 一个自定义分片实现要继承与抽象类InputSplit，通过定义输入的长度和位置。分片的位置暗示调度器如何是放置一个分片的执行器（即，选择一个合适的TaskTracker）

? JobTracker处理分片的算法大致是：

通过TaskTracker节点的心跳获取可用的map槽资源
从排队等候的分片中找出那些可用的节点是本地的
向TaskTracker提交分片

? 基于存储机制和执行策略，分片的大小和位置是有不同的意思。例如在HDFS上，一个分片和一个物理数据块是一致的，分片的位置是这个数据块的物理存放位置的一个集合。

? 下面是FileInputFormat工作的机制：

继承InputSplit，计算文件的信息。如文件中数据块的开始位置和块的长度
获取文件的数据块的一个集合
创建一个数据分片，这个分片的长度和块大小一样，分片位置为这个快的位置。此外还含有文件位置，块位移，长度等信息。

下面是FileInputFormat创建分片的代码：


/**
   * Generate the list of files and make them into FileSplits.
   * @param job the job context
   * @throws IOException
   */
  public List getSplits(JobContext job) throws IOException {
    Stopwatch sw = new Stopwatch().start();
    long minSize = Math.max(getFormatMinSplitSize(), getMinSplitSize(job));
    long maxSize = getMaxSplitSize(job);

    // generate splits
    List splits = new ArrayList();
    List files = listStatus(job);
    for (FileStatus file: files) {
      Path path = file.getPath();
      long length = file.getLen();
      if (length != 0) {
        BlockLocation[] blkLocations;
        if (file instanceof LocatedFileStatus) {
          blkLocatiOns= ((LocatedFileStatus) file).getBlockLocations();
        } else {
          FileSystem fs = path.getFileSystem(job.getConfiguration());
          blkLocatiOns= fs.getFileBlockLocations(file, 0, length);
        }

        if (isSplitable(job, path)) {
          long blockSize = file.getBlockSize();
          long splitSize = computeSplitSize(blockSize, minSize, maxSize);

          long bytesRemaining = length;
          while (((double) bytesRemaining)/splitSize > SPLIT_SLOP) {
            int blkIndex = getBlockIndex(blkLocations, length-bytesRemaining);
            splits.add(makeSplit(path, length-bytesRemaining, splitSize,
                        blkLocations[blkIndex].getHosts(),
                        blkLocations[blkIndex].getCachedHosts()));
            bytesRemaining -= splitSize;
          }

          if (bytesRemaining != 0) {
            int blkIndex = getBlockIndex(blkLocations, length-bytesRemaining);
            splits.add(makeSplit(path, length-bytesRemaining, bytesRemaining,
                       blkLocations[blkIndex].getHosts(),
                       blkLocations[blkIndex].getCachedHosts()));
          }
        } else { // not splitable
          splits.add(makeSplit(path, 0, length, blkLocations[0].getHosts(),
                      blkLocations[0].getCachedHosts()));
        }
      } else {
        //Create empty hosts array for zero length files
        splits.add(makeSplit(path, 0, length, new String[0]));
      }
    }
    // Save the number of input files for metrics/loadgen
    job.getConfiguration().setLong(NUM_INPUT_FILES, files.size());
    sw.stop();
    if (LOG.isDebugEnabled()) {
      LOG.debug("Total # of splits generated by getSplits: " + splits.size()
          + ", TimeTaken: " + sw.elapsedMillis());
    }
    return splits;
  }

方法创建分片过程主要做了下面几件事：1、首先从Job对象中获取输入文件的状态信息FileStatus。2.然后针对每个文件获取块信息。3.根据文件是否可分割按照分片大小进行切割,如果不能则不分割。

?案例：实现计算密集型InputFormat

有一种比较常见的MapReduce程序：计算密集型程序。

计算密集型MR程序即指：对于与每一个输入的键值对需要复杂的计算算法去处理，主要特征是每一个map处理函数需要比获取该处理数据更长的时间，至少一个量级。比如人脸识别程序。

如果使用默认的FileInputFormat去处理该类型应用的话，很大情况下会出现部门机器cpu负载过高，而其他的则比较闲。(可以通过ganglia监控分析)

默认情况下由于FileInputFormat的实现会根据数据的本地性来创建分片数据。然而对于计算密集型的程序数据的本地性可能不适合了。那我们应该如何做出改变呢？我们获取所有可用服务器各自计算能力的情况，根据服务器来分配创建分片。

因此我们需要重载分片函数。

下面我们重载SequenceFileInputFormat来演示如何实现上述要求：

ComputeIntensiveSequenceFileInputFormat继承SequenceFileInputFormat函数，重载gitSplits函数:

//重写分片函数
 @Override
 public List getSplits(JobContext job) throws IOException {
  String[] servers = getActiveServersList(job);
  if (servers == null)
   return null;
  List splits = new ArrayList();
  List files = listStatus(job);
  int currentServer = 0;
  for (FileStatus file : files) {
   Path path = file.getPath();
   long length = file.getLen();
   if ((length != 0) && isSplitable(job, path)) {
    long blockSize = file.getBlockSize();
    long splitSize = computeSplitSize(blockSize, minSize, maxSize);
    long bytesRemaining = length;
    while (((double) bytesRemaining) / splitSize > SPLIT_SLOP) {
     splits.add(new FileSplit(path, length - bytesRemaining,
       splitSize, new String[] { servers[currentServer] }));
     currentServer = getNextServer(currentServer, servers.length);
     bytesRemaining -= splitSize;
    }
   } else if (length != 0) {
    splits.add(new FileSplit(path, 0, length,
      new String[] { servers[currentServer] }));
    currentServer = getNextServer(currentServer, servers.length);
   }
  }
  // Save the number of input files in the job-conf
  job.getConfiguration().setLong(NUM_INPUT_FILES, files.size());
  return splits;
 }
 //获取服务器列表
 private String[] getActiveServersList(JobContext context) {
  String[] servers = null;
  try {
   JobClient jc = new JobClient((JobConf) context.getConfiguration());
   ClusterStatus status = jc.getClusterStatus(true);
   Collection atc = status.getActiveTrackerNames();
   servers = new String[atc.size()];
   int s = 0;
   for (String serverInfo : atc) {
    StringTokenizer st = new StringTokenizer(serverInfo, ":");
    String trackerName = st.nextToken();
    StringTokenizer st1 = new StringTokenizer(trackerName, "_");
    st1.nextToken();
    servers[s++] = st1.nextToken();
   }
  } catch (IOException e) {
   e.printStackTrace();
  }
  return servers;
 }
 //选择一个服务器
 private static int getNextServer(int current, int max) {
  current++;
  if (current >= max)
   current = 0;
  return current;
 }

这个类继承于SequenceFileInputFormat，重写了getSplits()函数。计算分片的和FileInputFormat一样。只是原来数据的物理本地性由可用的服务器资源代替。两个主要函数：
getActiveServersList() 查询集群状态，计算一个可用的服务器名字列表
getNextServer() 获取一个服务器

优化：
上面方案是否就已经很完美，没有问题了呢？答案是否定的。
在上面我们替换了数据物理本地性这个特性，那么会导致更多的数据传输的问题，会给网络io带来压力，影响io性能。

因此我们想到可以把两个策略综合起来。首先放置尽可能多的任务为本地，分发剩下的到其他节点。
下面是实现这个方案的程序ComputeIntensiveLocalizedSequenceFileInputFormat：

@Override
 public List getSplits(JobContext job) throws IOException {
  List originalSplits = super.getSplits(job);
  String[] servers = getActiveServersList(job);
  if (servers == null)
   return null;
  List splits = new ArrayList(
    originalSplits.size());
  int numSplits = originalSplits.size();
  int currentServer = 0;
  for (int i = 0; i 
这里第一步利用父类（FileInputFormat)）获取分片来确保数据本地性。对于每一个服务器，首先试着去指定本地的split给它。其他没有本地分片的则随机分配剩下的分片。

总结：
MapReduce的输入格式的重写主要要主要两个组件：InputFormat和Recordreader。本文主要讲述InputFormat的原理及怎么来重写InputFormat，根据业务的特点选择创建分片的策略。
    
        原文地址：MR总结(三)-MapReduce组件自定义, 感谢原作者分享。

推荐阅读

交换机
[译]技术公司十年经验的职场生涯回顾

本文是一位在技术公司工作十年的职场人士对自己职业生涯的总结回顾。她的职业规划与众不同，令人深思又有趣。其中涉及到的内容有机器学习、创新创业以及引用了女性主义者在TED演讲中的部分讲义。文章表达了对职业生涯的愿望和希望，认为人类有能力不断改善自己。 ... [详细]

蜡笔小新 2023-12-14 11:31:05
服务器
什么是大数据lambda架构

一、什么是Lambda架构Lambda架构由Storm的作者[NathanMarz]提出，根据维基百科的定义，Lambda架构的设计是为了在处理大规模数 ... [详细]

蜡笔小新 2023-10-17 16:06:09
服务器
Hadoop （CDH4发行版）集群部署（部署脚本，namenode高可用，hadoop管理）

前言折腾了一段时间hadoop的部署管理，写下此系列博客记录一下。为了避免各位做部署这种重复性的劳动，我已经把部署的步骤写成脚本，各位只需要按着本文把脚本执行完，整个环境基本就部署 ... [详细]

蜡笔小新 2023-10-16 15:11:51
apache
Hadoop之Yarn

目录1Hadoop1.x和Hadoop2.x架构区别2Yarn概述3Yarn基本架构4Yarn工作机制5作业提交全过程6资源调度器7任务的推测执行1Hadoop1.x和Hadoo ... [详细]

蜡笔小新 2023-10-15 12:16:30
linux
windows部署hadoop2.7.0

这里使用自己编译的hadoop-2.7.0版本部署在windows上，记得几年前，部署hadoop需要借助于cygwin，还需要开启ssh服务，最近发现，原来不需要借助cy ... [详细]

蜡笔小新 2023-10-17 21:04:04
linux
MR程序的几种提交运行模式

MR程序的几种提交运行模式本地模型运行1在windows的eclipse里面直接运行main方法，就会将job提交给本地执行器localjobrunner执行-- ... [详细]

蜡笔小新 2023-10-16 18:29:26
服务器
伸缩性|发生_分布式文件系统设计，该从哪些方面考虑？

篇首语：本文由编程笔记#小编为大家整理，主要介绍了分布式文件系统设计，该从哪些方面考虑？相关的知识，希望对你有一定的参考价值。点击上方关注“ ... [详细]

蜡笔小新 2023-10-16 17:43:40
linux
Kylin 单节点安装

软件环境Hadoop:2.7,3.1(sincev2.5)Hive:0.13-1.2.1HBase:1.1,2.0(sincev2.5)Spark(optional)2.3.0K ... [详细]

蜡笔小新 2023-10-16 16:09:42
linux
MapReduce工作流程最详细解释

MapReduce是我们再进行离线大数据处理的时候经常要使用的计算模型，MapReduce的计算过程被封装的很好，我们只用使用Map和Reduce函数，所以对其整体的计算过程不是太 ... [详细]

蜡笔小新 2023-10-16 14:14:27
linux
Azkaban（三）Azkaban的使用

界面介绍首页有四个菜单projects：最重要的部分，创建一个工程，所有flows将在工程中运行。scheduling:显示定时任务executing:显示当前运行的任务histo ... [详细]

蜡笔小新 2023-10-15 23:43:11
linux
访问控制_身份认证和访问控制技术学习20199319

身份认证技术1、常用的身份认证方法（1）静态口令认证的问题：静态口令，即由用户自己设置或者系统给 ... [详细]

蜡笔小新 2023-10-15 20:56:15
linux
Java开发实战讲解！字节跳动三场技术面+HR面

二、回顾整理阿里面试题基本就这样了，还有一些零星的问题想不起来了，答案也整理出来了。自我介绍JVM如何加载一个类的过程，双亲委派模型中有 ... [详细]

蜡笔小新 2023-10-15 19:48:25
linux
mapreduce原理_MapReduce原理及WordCount实践

参考链接：https:www.cnblogs.comlaowangcp8961946.html一、MapReduce流程1.1Mapreduce整体流程： ... [详细]

蜡笔小新 2023-10-14 17:48:33
linux
Centos7.6安装Gitlab教程及注意事项

本文介绍了在Centos7.6系统下安装Gitlab的详细教程，并提供了一些注意事项。教程包括查看系统版本、安装必要的软件包、配置防火墙等步骤。同时，还强调了使用阿里云服务器时的特殊配置需求，以及建议至少4GB的可用RAM来运行GitLab。 ... [详细]

蜡笔小新 2023-12-14 14:01:06
linux
iServer集成Hadoop YARN集群，详细操作指南解析分布式分析

HadoopYARN集群是一个通用的资源管理平台，可为各类计算框架提供资源的管理和调度。其核心是通过一个全局的资源管理器来实现分离资源管理与作业调度监控。Hadoop ... [详细]

蜡笔小新 2023-10-14 16:24:53