Hadoop 文件格式

栏目: 服务器 · 发布时间: 7年前

内容简介:Hadoop 文件格式

CSV

CSV(Comma-Separated Value 逗号分隔值)

特性

  • 文本文件
  • 面向行
  • 记录被分隔符分隔为字段
  • 记录有着相同的字段序列

场景

易于解析,适用于从 Sqoop 导入到 HDFS 或从 HDFS 导出到数据库的文件格式

提示

  1. 文本编码
  2. 保证记录中的字段不包含分隔符(使用不常用的字符作为分隔符或者替换字段中的分隔符)
  3. 使用 Apache Commons Lang 3 项目的 StringUtils.splitPreserveAllTokens 替换 Java String 自带的 string.split 解析 CSV

JSON

JSON(JavaScript Object Notation JavaScript 对象标记)

特性

  • 文本文件
  • 面向行

场景

可读性好,适用于调试

Avro

Apache Avro

特性

  • 序列化框架
  • 自描述 Schema
  • 面向行
  • 可分片
  • 支持内部压缩

场景

空间利用率高,适用于归档数据

Parquet

Apache Parquet

特性

  • 自描述 Schema
  • 面向列
  • 可分片
  • 支持内部压缩

场景

列式存储,适用于结构化查询

Kudu

Apache Kudu

特性

  • 面向列

场景

列式存储,适用于流处理


以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持 码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们

亮剑.NET

亮剑.NET

2009-3 / 55.00元

《亮剑.NET:SharePoint Server 2007开发实战》共分为8章,详细讲解了SharePoint上常见的开发任务,讲述了各种开发场景下需要了解的知识,并提供了丰富的实例。《亮剑.NET:SharePoint Server 2007开发实战》第1章为基础知识,讲述SharePoint的基本概念,基本的对象模型,代码编写注意事项,并讲解了一个集开发和部署打包为一体的项目结构的创建;第2......一起来看看 《亮剑.NET》 这本书的介绍吧!

URL 编码/解码
URL 编码/解码

URL 编码/解码

HSV CMYK 转换工具
HSV CMYK 转换工具

HSV CMYK互换工具