美国怀俄明的Delta Lake
本文来自2019年6月26日在美国波士顿举办的 Spark Meetup,分享者是正是砖厂(Databricks)的大神 Michael Armbrust。 Michael Armbrust 是 Spark SQL 的原创者,也是 Structured Streaming 的原创者,最近几年在做 Delta Lake。
下面这句话引用自:https://www.jianshu.com/p/3fef83ce1dba
Spark 做为一个计算引擎,应该无须质疑是当前大数据行业的领导者。。。而 Parquet 做为 Spark 的缺省数据存储格式,其实相当薄弱,缺少了太多关键特性,让Spark的用户不胜其扰,简直是Spark易用性的最大敌人!社区的抱怨可谓绵绵不绝,这种对于技术完美主义者,是无法容忍的!!!在这种背景下,Delta 开始了设计和实现。。。Databricks一年多前推出Delta之后,各位客户好评不断,但是我们只在有限的cloud上提供服务。这个实在无法满足那些在on prem上大量部署Spark的整个社区!于是乎,今年Spark Summit,使用Apache license 开源 了!可以参见 《 重磅 | Apache Spark 社区期待的 Delta Lake 开源了 》
Delta Lake 功能强大,但是网上关于这个方面的文章少的可怜,特别是关于 Delta Lake 的内部工作原理更是凤毛麟角。最有资格介绍 Delta Lake 诞生背景以及内部工作原理的人非 Michael Armbrust 莫属,基于这些,Michael Armbrust 大神给我们带来了名为《Delta Lake: Open Source Reliability and Quality for Data Lakes》的分享,给我们介绍了 Delta Lake 的前世今生,引进 Delta Lake 的内部工作原理,值得一看。
本次分享的视频可以到下面地方获取:
优酷:
https://v.youku.com/v_show/id_XNDI0OTE4NzYzNg
YouTube(有字幕):
https://www.youtube.com/watch?v=whaV6bMaf5o
本文PPT请关注 Hadoop技术博文 公众号并回复 delta_lake 获取。
以上就是本文的全部内容,希望本文的内容对大家的学习或者工作能带来一定的帮助,也希望大家多多支持 码农网
本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们。
计算机科学概论(第7版) (平装)
J.Glenn Brookshear / 王保江 / 人民邮电出版社 / 2003-9 / 49.0
《计算机科学概论(第2版)》更新了部分内容,使其更加贴近于计算机科学领域内的最新趋势,这包括了网络安全、开源运动、关联存储、公钥加密、XML、Java和C#等内容。扩充了网络和Internet所覆盖的内容。一个程序用C#语言编写,还有C、C++和Java,作为语言的例子。不过整个方法依旧保持语言的独立。一起来看看 《计算机科学概论(第7版) (平装)》 这本书的介绍吧!