大数据的切片机制有哪些

FileInputFormat切片机制

框架默认的TextInputFormat切片机制是对任务按文件规划切片，不管文件多小，都会是一个单独的切片，都会交给一个MapTask，这样如果有大量小文件，就会产生大量的MapTask，处理效率极其低下。

1、应用场景：

CombineTextInputFormat用于小文件过多的场景，它可以将多个小文件从逻辑上规划到一个切片中，这样，多个小文件就可以交给一个MapTask处理。

注意：虚拟存储切片最大值设置最好根据实际的小文件大小情况来设置具体的值。

3、切片机制

生成切片过程包括：虚拟存储过程和切片过程二部分。

（1）虚拟存储过程：

将输入目录下所有文件大小，依次和设置的setMaxInputSplitSize值比较，如果不大于设置的最大值，逻辑上划分一个块。如果输入文件大于设置的最大值且大于两倍，那么以最大值切割一块；当剩余数据大小超过设置的最大值且不大于最大值2倍，此时将文件均分成2个虚拟存储块（防止出现太小切片）。

例如setMaxInputSplitSize值为4M，输入文件大小为8.02M，则先逻辑上分成一个4M。剩余的大小为4.02M，如果按照4M逻辑划分，就会出现0.02M的小的虚拟存储文件，所以将剩余的4.02M文件切分成（2.01M和2.01M）两个文件。

（2）切片过程：

（a）判断虚拟存储的文件大小是否大于setMaxInputSplitSize值，大于等于则单独形成一个切片。

（b）如果不大于则跟下一个虚拟存储文件进行合并，共同形成一个切片。

（c）测试举例：有4个小文件大小分别为1.7M、5.1M、3.4M以及6.8M这四个小文件，则虚拟存储之后形成6个文件块，大小分别为：

1.7M，（2.55M、2.55M），3.4M以及（3.4M、3.4M）

最终会形成3个切片，大小分别为：

（1.7+2.55）M，（2.55+3.4）M，（3.4+3.4）M

想要了解更多关于大数据技术内容欢迎关注尚硅谷教育！

大数据项目架构

大数据技术生态体系

大数据JUC面试题

大数据之Kafka集群部署

大数据logstsh架构

展开阅读全文

页面更新：2024-05-19

标签：切片机制都会数据文件大小最大值架构低下剩余框架逻辑场景大小过程文件科技

1 2 3 4 5

大数据的切片机制有哪些

FileInputFormat切片机制

常规性能调优RDD优化

玩转Spark Sql优化之提交参数控制（三）

web前端js框架有哪些

重装上阵 | 尚硅谷Vue新版视频教程发布

Native、PC寄存器

Hive之数据仓库

尚硅谷RocketMQ视频教程发布，集齐3Q横扫中间件

SpringMV内容HttpMessageConverter原理

MySQL之排序分组优化索引的选择

Spring容器初始化和解决循环依赖问题的分析

SpringBoot优缺点

JavaScript 数组Array相关的属性和方法

玩转Spark Sql优化之使用堆外内存（二）

使用Change Stream实时同步MongoDB数据（下）

AngularJS 表达式

web前端js框架有哪些

Hive之数据仓库

使用Change Stream实时同步MongoDB数据（下）

JVM GC导致的shuffle文件拉取失败

英特尔重启晶圆代工业务，恐将加剧中美科技战？

24.2亿元收购欧菲光两项资产，闻泰科技即将进入苹果供应

Tomcat系统架构分析

尚硅谷大数据-数仓图书版权输出中国台湾

SpringMVC课程之JSR303数据校验

抛弃MIPS！龙芯自主指令系统架构正式发布：龙芯3A5000首发