Apache Beam 2.25.0 发布,大数据流处理与批处理编程范式

栏目: 软件资讯 · 发布时间: 3年前

内容简介:Apache Beam 2.25.0 发布了。Beam 是一个用于定义和执行数据处理管道的统一编程模型,包括 ETL、批处理与流处理。Beam 项目重点在于数据处理的编程范式和接口定义,并不涉及具体执行引擎的实现,理想情况是基于 ...

Apache Beam 2.25.0 发布了。Beam 是一个用于定义和执行数据处理管道的统一编程模型,包括 ETL、批处理与流处理。Beam 项目重点在于数据处理的编程范式和接口定义,并不涉及具体执行引擎的实现,理想情况是基于 Beam 开发的数据处理程序可以执行在任意的分布式计算引擎上。

此版本主要特性变更包括:

  • 在 ReadFromBigQuery 的 JSON 解码器中增加了对可重复字段的支持。(Python)
  • 为 Python SDK 添加了一个 opt-in、performance-driven 的运行时类型检查系统。
  • 添加了对使用 typed PCollections 的 PTransforms 上的 Python 3 类型注释的支持。
  • 改进了 Interactive Beam API,streaming jobs 现在可以启动长时间运行的后台录制作业。从 recording 中运行 ib.show() 或 ib.collect() samples。
  • 在 Interactive Beam 中,ib.show() 和 ib.collect() 现在具有“n”和“duration”作为参数。这些意味着最多只能读取“ n”个元素,并且最多只能从 recording 中读取“duration”秒的数据。
  • Dataframes 支持的初步预览。
  • 修复了 Python SDK 中对 @ptransform_fn 装饰符的类型提示支持。默认情况下未启用此功能以保持向后兼容性;可使用 --type_check_additional=ptransform_fn标志启用。在以后的 Beam 版本中,可能会默认启用它。
  • 添加了 X feature(Java/Python)。

详情查看更新说明:https://github.com/apache/beam/blob/master/CHANGES.md#2250---2020-10-23


以上就是本文的全部内容,希望本文的内容对大家的学习或者工作能带来一定的帮助,也希望大家多多支持 码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们

深度探索C++对象模型(影印版)

深度探索C++对象模型(影印版)

Stanley B. Lippman / 中国电力出版社 / 2003-8-1 / 42.00

本书重点介绍了C++面向对象程序设计的底层机制,包括结构式语意、暂时性对象的生成、封装、继承和虚拟——虚拟函数和虚拟继承。书中向你表明:理解底层实现模型,可以极大地提高你的编码效率。Lippman澄清了那些关于C++系统开销与复杂性的各种错误信息和猜测,指出了其中某些成本和利益交换确实存在。他在书中详述了各种实现模型,指出了它们的发展方向以及促使其发展的根本原因。本书涵盖了C++对象模型的语意暗示......一起来看看 《深度探索C++对象模型(影印版)》 这本书的介绍吧!

JS 压缩/解压工具
JS 压缩/解压工具

在线压缩/解压 JS 代码

JSON 在线解析
JSON 在线解析

在线 JSON 格式化工具

UNIX 时间戳转换
UNIX 时间戳转换

UNIX 时间戳转换