标签:hcatalog hive month job mr new class schema
重要 | mr使用hcatalog读写hive表
浪尖 浪尖聊大数据
本文主要是讲mapreduce使用HCatalog读写hive表。
hcatalog使得hive的元数据可以很好的被其它hadoop工具使用,比如pig,mr和hive。
HCatalog的表为用户提供了(HDFS)中数据的关系视图,并确保用户不必担心他们的数据存储在何处或采用何种格式,因此用户无需知道数据是否以RCFile格式存储, 文本文件或sequence 文件。
它还提供通知服务,以便在仓库中有新数据可用时通知工作流工具(如Oozie)。
HCatalog提供HCatInputFormat / HCatOutputFormat,使MapReduce用户能够在Hive的数据仓库中读/写数据。 它允许用户只读取他们需要的表和列的分区。 返回的记录格式是方便的列表格式,用户无需解析它们。
下面我们举个简单的例子。
在mapper类中,我们获取表schema并使用此schema信息来获取所需的列及其值。
下面是map类。
public class onTimeMapper extends Mapper {
@Override
protected void map(WritableComparable key, HCatRecord value,
org.apache.hadoop.mapreduce.Mapper.Context context)
throws IOException, InterruptedException {
// Get table schema
HCatSchema schema = HCatBaseInputFormat.getTableSchema(context);
Integer year = new Integer(value.getString("year", schema));
Integer month = new Integer(value.getString("month", schema));
Integer DayofMonth = value.getInteger("dayofmonth", schema);
context.write(new IntPair(year, month), new IntWritable(DayofMonth));
}
}
在reduce类中,会为将要写入hive表中的数据创建一个schema。
public class onTimeReducer extends Reducer {
public void reduce (IntPair key, Iterable value, Context context)
throws IOException, InterruptedException{
int count = 0; // records counter for particular year-month
for (IntWritable s:value) {
count++;
}
// define output record schema
List columns = new ArrayList(3);
columns.add(new HCatFieldSchema("year", HCatFieldSchema.Type.INT, ""));
columns.add(new HCatFieldSchema("month", HCatFieldSchema.Type.INT, ""));
columns.add(new HCatFieldSchema("flightCount", HCatFieldSchema.Type.INT,""));
HCatSchema schema = new HCatSchema(columns);
HCatRecord record = new DefaultHCatRecord(3);
record.setInteger("year", schema, key.getFirstInt());
record.set("month", schema, key.getSecondInt());
record.set("flightCount", schema, count);
context.write(null, record);
}
}
最后,创建driver类,并且表明输入输出schema和表信息。
public class onTimeDriver extends Configured implements Tool{
private static final Log log = LogFactory.getLog( onTimeDriver.class );
public int run( String[] args ) throws Exception{
Configuration conf = new Configuration();
Job job = new Job(conf, "OnTimeCount");
job.setJarByClass(onTimeDriver.class);
job.setMapperClass(onTimeMapper.class);
job.setReducerClass(onTimeReducer.class);
HCatInputFormat.setInput(job, "airline", "ontimeperf");
job.setInputFormatClass(HCatInputFormat.class);
job.setMapOutputKeyClass(IntPair.class);
job.setMapOutputValueClass(IntWritable.class);
job.setOutputKeyClass(Text.class);
job.setOutputValueClass(DefaultHCatRecord.class);
job.setOutputFormatClass(HCatOutputFormat.class);
HCatOutputFormat.setOutput(job, OutputJobInfo.create("airline", "flight_count", null));
HCatSchema s = HCatOutputFormat.getTableSchema(job);
HCatOutputFormat.setSchema(job, s);
return (job.waitForCompletion(true)? 0:1);
}
public static void main(String[] args) throws Exception{
int exitCode = ToolRunner.run(new onTimeDriver(), args);
System.exit(exitCode);
}
}
当然,在跑上面写的代码之前,应该先在hive中创建输出表。
create table airline.flight_count
(Year INT ,
Month INT ,
flightCount INT)
ROW FORMAT DELIMITED FIELDS TERMINATED BY ','
STORED AS TEXTFILE;
可能会引起错误的地方是没有设置$HIVE_HOME.
[完]
标签:hcatalog,hive,month,job,mr,new,class,schema
来源: https://blog.51cto.com/15127544/2664767
本站声明:
1. iCode9 技术分享网(下文简称本站)提供的所有内容,仅供技术学习、探讨和分享;
2. 关于本站的所有留言、评论、转载及引用,纯属内容发起人的个人观点,与本站观点和立场无关;
3. 关于本站的所有言论和文字,纯属内容发起人的个人观点,与本站观点和立场无关;
4. 本站文章均是网友提供,不完全保证技术分享内容的完整性、准确性、时效性、风险性和版权归属;如您发现该文章侵犯了您的权益,可联系我们第一时间进行删除;
5. 本站为非盈利性的个人网站,所有内容不会用来进行牟利,也不会利用任何形式的广告来间接获益,纯粹是为了广大技术爱好者提供技术内容和技术思想的分享性交流网站。