hadoop 各类key value分隔符参数-zzjlzx-ChinaUnix博客

zzjlzxzzjlzx.blog.chinaunix.net

首页　| 　博文目录　| 　关于我

zzjlzx

博客访问： 10653855
博文数量： 1669
博客积分： 16831
博客等级：上将
技术积分： 12594
用户组：普通用户
注册时间： 2011-02-25 07:23

个人简介

柔中带刚，刚中带柔，淫荡中富含柔和，刚猛中荡漾风骚，无坚不摧，无孔不入！

文章分类

全部博文（1669）

NGINX（1）
MongoDB（2）
docker（8）
shadowsocks（1）
CloudFoundry（11）
CloudStack（102）
openstack（61）
PHP（0）
mail（0）
hadoop（25）
GemFire（1）
文件系统（4）
CDN（7）
下载及资源（15）
数据缓存（8）
web 加速（9）
分布式文件系统架（23）
虚拟化（133）
同步（6）
网站架构（50）
windows 监控（15）
mysql 监控（5）
oracle 监控（2）
linux 监控（24）
web 监控（35）
其他数据库（27）
备份恢复（28）
VPN及认证（24）
云系统（29）
windows（29）
WEB 故障（13）
mysql 备份（10）
oracle 集群（15）
HA及负载均衡（52）
存储（66）
shell（39）
web 应用（19）
mysql 优化（16）
mysql 故障（14）
mysql 安全（8）
mysql 配置（29）
mysql 应用（10）
web 安全（21）
SAN交换路由（26）
web 优化（46）
基础解释（24）
linux 安全（37）
linux 故障（22）
linux 应用（85）
linux 配置（64）
web 配置（23）
oracle 备份（33）
UNIX（12）
Solaris（5）
Aix（1）
oracle 配置（69）
oracle 优化（62）
oracle 安全（10）
oracle 应用（30）
交流（29）
oracle 故障（59）
linux 优化（31）
未分配的博文（4）

文章存档

2023年（4）

2022年（1）

2021年（10）

2020年（24）

2019年（4）

2018年（19）

2017年（66）

2016年（60）

2015年（49）

2014年（201）

2013年（221）

2012年（638）

2011年（372）

我的朋友

相关博文

hadoop 各类key value分隔符参数

分类： HADOOP

2013-11-29 11:43:20

hadoop 各类key value分隔符参数
分类： hadoop 收藏 2012-04-15 21:40 438人阅读评论(0) 收藏举报
hadoopcoutputinput
原文地址：http://wingmzy.iteye.com/blog/1260570

hadoop中的map-reduce是处理这样的键值对，故指定的分割符等参数可以分成三类：

map输出时分割符

分桶时的分隔符

reduce输出时的分割符

下面分别叙述：

1. map输出时分割符

参数：

stream.map.output.field.separator

作用：

指定map输出时的分割符

stream.num.map.output.key.fields

指定输出按照分隔符切割后，key所占有的列数

举例：

input数据：

2,2,c,c,c,c

参数配置：

-mapper "cat" # map 为分布式的cat命令

-reducer "" #reduce为空 /

-jobconf stream.map.output.field.separator=',' /

-jobconf stream.num.map.output.key.fields=2 /

即按照','逗号分隔后，去前2列作为key

output数据：

2,2 c,c,c,c #其中key为2,2 value为c,c,c,c

2. 分桶时的分隔符

map.output.key.field.separator

指定map输出对之后，其中key内部的分割符

num.key.fields.for.partition

指定分桶时，按照分隔符切割后，用于分桶key所占的列数

举例：

map的output数据：

2,2 c,c,c,c

参数配置：
-jobconf map.output.key.field.separator=',' /
-jobconf num.key.fields.for.partition='1' /
-partitioner org.apache.hadoop.mapred.lib.KeyFieldBasedPartitioner /

output数据：

这样用于partition分桶的key就为：2

注意，这里分桶不应该用默认的HashPartitioner

3. reduce输出时的分割符

这个与map类似，分别用于reduce输出时分隔符以及key占有的列数

stream.reduce.output.field.separator

stream.num.reduce.output.key.fields

阅读(1556) | 评论(0) | 转发(0) |

上一篇：在多硬盘情况下的Hadoop配置注意项

下一篇：查看HADOOP中一个文件有多少块组成及所在机器ip

给主人留下些什么吧！~~

感谢所有关心和支持过ChinaUnix的朋友们

16024965号-6