Apache Beam 2.28.0 发布，大数据流处理与批处理编程范式

栏目: 软件资讯 · 发布时间: 5年前

内容简介：Apache Beam 2.28.0 已发布，Beam 是一个用于定义和执行数据处理管道的统一编程模型，包括 ETL、批处理与流处理。Beam 项目重点在于数据处理的编程范式和接口定义，并不涉及具体执行引擎的实现，理想情况是基于 ...

Apache Beam 2.28.0 已发布，Beam 是一个用于定义和执行数据处理管道的统一编程模型，包括 ETL、批处理与流处理。Beam 项目重点在于数据处理的编程范式和接口定义，并不涉及具体执行引擎的实现，理想情况是基于 Beam 开发的数据处理程序可以执行在任意的分布式计算引擎上。

更新亮点

与 Parquet 支持相关的大量改进（BEAM-11460, BEAM-8202 和 BEAM-11526）
BeamSQL 中的哈希函数 (BEAM-10074)
ZetaSQL 中的哈希函数 (BEAM-11624)
使用 HLL Impl 创建 ApproximateDistinct (BEAM-10324)

I/Os

SpannerIO 支持面向 Numeric 字段使用 BigDecimal (BEAM-11643)

将 Beam schema 支持添加到 ParquetIO (BEAM-11526)
支持 ParquetTable Writer (BEAM-8202)
GCP BigQuery sink (streaming inserts) 使用 runner 已确定的分片 (BEAM-11408)
PubSub 支持类型：TIMESTAMP, DATE, TIME, DATETIME (BEAM-11533)

新特性/改进

ParquetIO 添加 readGenericRecords 和 readFilesGenericRecords 方法可以读取具有未知 schema 的文件。详情查看 PR-13554 和 (BEAM-11460)
添加对 KafkaTableProvider 中 thrift 的支持 (BEAM-11482)
添加对 HadoopFormatIO 的支持以跳过 key/value 克隆 (BEAM-11457)
在 Convert.to 转换中支持转换为 GenericRecords (BEAM-11571)
支持读取未知 schema 的 Parquet 文件 (BEAM-11460)

发布公告

以上就是本文的全部内容，希望本文的内容对大家的学习或者工作能带来一定的帮助，也希望大家多多支持码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络，本站转载出于传递更多信息之目的，版权归原作者或者来源机构所有，如转载稿涉及版权问题，请联系我们。

码农书籍

算法V

塞奇威克 (Robert Sedgewick) / 中国电力出版社 / 2003-12 / 54.0

Robert Sedgewick再次给我们提供了重要的流行算法的全面介绍。这次的重点是图形算法，图形算法在很多应用中已日益重要，诸如网络连接、电路设计、调度、事务处理以及资源分配。本书中，Sedgewick同样用简洁的实现将理论和实践成功地结合了起来，这些实现均可在真实应用上测试，这也正是他的著作多年来倍受程序员欢迎的原因。　　本书是Sedgewick彻底修订和重写的丛书中的第二本。第一本......一起来看看《算法V》这本书的介绍吧!

码农工具

Apache Beam 2.28.0 发布，大数据流处理与批处理编程范式

算法V

XML、JSON 在线转换

RGB HSV 转换

HEX HSV 转换工具