Hadoop 文件格式

栏目: 服务器 · 发布时间: 8年前

内容简介:Hadoop 文件格式

CSV

CSV(Comma-Separated Value 逗号分隔值)

特性

  • 文本文件
  • 面向行
  • 记录被分隔符分隔为字段
  • 记录有着相同的字段序列

场景

易于解析,适用于从 Sqoop 导入到 HDFS 或从 HDFS 导出到数据库的文件格式

提示

  1. 文本编码
  2. 保证记录中的字段不包含分隔符(使用不常用的字符作为分隔符或者替换字段中的分隔符)
  3. 使用 Apache Commons Lang 3 项目的 StringUtils.splitPreserveAllTokens 替换 Java String 自带的 string.split 解析 CSV

JSON

JSON(JavaScript Object Notation JavaScript 对象标记)

特性

  • 文本文件
  • 面向行

场景

可读性好,适用于调试

Avro

Apache Avro

特性

  • 序列化框架
  • 自描述 Schema
  • 面向行
  • 可分片
  • 支持内部压缩

场景

空间利用率高,适用于归档数据

Parquet

Apache Parquet

特性

  • 自描述 Schema
  • 面向列
  • 可分片
  • 支持内部压缩

场景

列式存储,适用于结构化查询

Kudu

Apache Kudu

特性

  • 面向列

场景

列式存储,适用于流处理


以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持 码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们

Mastering JavaServer Faces

Mastering JavaServer Faces

Bill Dudney、Jonathan Lehr、Bill Willis、LeRoy Mattingly / Wiley / 2004-6-7 / USD 40.00

Harness the power of JavaServer Faces to create your own server-side user interfaces for the Web This innovative book arms you with the tools to utilize JavaServer Faces (JSF), a new standard that wi......一起来看看 《Mastering JavaServer Faces》 这本书的介绍吧!

JS 压缩/解压工具
JS 压缩/解压工具

在线压缩/解压 JS 代码

SHA 加密
SHA 加密

SHA 加密工具

HEX CMYK 转换工具
HEX CMYK 转换工具

HEX CMYK 互转工具