内容简介:Hadoop 文件格式
CSV
CSV(Comma-Separated Value 逗号分隔值)
特性
- 文本文件
- 面向行
- 记录被分隔符分隔为字段
- 记录有着相同的字段序列
场景
易于解析,适用于从 Sqoop 导入到 HDFS 或从 HDFS 导出到数据库的文件格式
提示
- 文本编码
- 保证记录中的字段不包含分隔符(使用不常用的字符作为分隔符或者替换字段中的分隔符)
-
使用 Apache Commons Lang 3 项目的
StringUtils.splitPreserveAllTokens替换 Java String 自带的string.split解析 CSV
JSON
JSON(JavaScript Object Notation JavaScript 对象标记)
特性
- 文本文件
- 面向行
场景
可读性好,适用于调试
Avro
特性
- 序列化框架
- 自描述 Schema
- 面向行
- 可分片
- 支持内部压缩
场景
空间利用率高,适用于归档数据
Parquet
特性
- 自描述 Schema
- 面向列
- 可分片
- 支持内部压缩
场景
列式存储,适用于结构化查询
Kudu
特性
- 面向列
场景
列式存储,适用于流处理
以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持 码农网
本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们。
神一样的产品经理
闫荣 / 电子工业出版社 / 2012-6-1 / 79.00元
这是一本系统阐述移动与互联网产品从无到有、从有到优的产品经理实践案例著作。《神一样的产品经理:基于移动与互联网产品实践》贯穿着“人如产品,产品如人”、“产品的根基和源泉来自现实生活”的写作理念,表达了产品的成功需要神一样的产品经理管理的观点。 《神一样的产品经理:基于移动与互联网产品实践》由浅入深、循序渐进地阐述了产品经理、产品需求、用户体验、项目管理、产品运营和产品团队管理的内容,理论与实......一起来看看 《神一样的产品经理》 这本书的介绍吧!