内容简介:Hadoop 文件格式
CSV
CSV(Comma-Separated Value 逗号分隔值)
特性
- 文本文件
- 面向行
- 记录被分隔符分隔为字段
- 记录有着相同的字段序列
场景
易于解析,适用于从 Sqoop 导入到 HDFS 或从 HDFS 导出到数据库的文件格式
提示
- 文本编码
- 保证记录中的字段不包含分隔符(使用不常用的字符作为分隔符或者替换字段中的分隔符)
-
使用 Apache Commons Lang 3 项目的
StringUtils.splitPreserveAllTokens替换 Java String 自带的string.split解析 CSV
JSON
JSON(JavaScript Object Notation JavaScript 对象标记)
特性
- 文本文件
- 面向行
场景
可读性好,适用于调试
Avro
特性
- 序列化框架
- 自描述 Schema
- 面向行
- 可分片
- 支持内部压缩
场景
空间利用率高,适用于归档数据
Parquet
特性
- 自描述 Schema
- 面向列
- 可分片
- 支持内部压缩
场景
列式存储,适用于结构化查询
Kudu
特性
- 面向列
场景
列式存储,适用于流处理
以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持 码农网
猜你喜欢:- Class 文件格式详解
- 一张图看懂FLV文件格式
- [译] 文件系统格式算是 ABI 吗?
- X.509、PKCS文件格式介绍
- Linux EXT系列文件系统格式
- 解决从旧格式的 csproj 迁移到新格式的 csproj 格式 AssemblyInfo 文件值重复问题
本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们。
CSS3专业网页开发指南
Peter Gasston / 李景媛、吴晓嘉 / 人民邮电出版社 / 2014-3-1 / 45.00元
《CSS3专业网页开发指南》是英国著名Web前端开发工程师Peter Gasston对CSS3高级技术的全面介绍。书中既有CSS3的发展历史、基本语法等入门知识介绍,也涵盖了媒体查询、选择器、伪类与伪元素、网页字体、文本排版、图形处理、动画、布局等CSS3前端开发必不可少的知识,还介绍了CSS3的未来发展方向。全书共分为17章,作者在每一章的讲解中都结合了大量的实例,同时也不忘介绍每一项技术的发展......一起来看看 《CSS3专业网页开发指南》 这本书的介绍吧!