文章 2024-03-12 来自:开发者社区

一文彻底理解Apache Hudi的清理服务

Apache Hudi提供了MVCC并发模型,保证写入端和读取端之间快照级别隔离。在本篇博客中我们将介绍如何配置来管理多个文件版本,此外还将讨论用户可使用的清理机制,以了解如何维护所需数量的旧文件版本,以使长时间运行的读取端不会失败。 1. 回收空间以控制存储成本 Hudi 提供不同的表管理服务来管理数据湖上表的数据,其中一项服务称为Cleaner(清理服务)。随着用户向表中写入...

一文彻底理解Apache Hudi的清理服务
文章 2022-05-07 来自:开发者社区

一文彻底理解Apache Hudi的多版本清理服务

1. 回收空间以控制存储成本Hudi 提供不同的表管理服务来管理数据湖上表的数据,其中一项服务称为Cleaner(清理服务)。 随着用户向表中写入更多数据,对于每次更新,Hudi会生成一个新版本的数据文件用于保存更新后的记录(COPY_ON_WRITE) 或将这些增量更新写入日志文件以避免重写更新版本的数据文件 (MERGE_ON_READ)。 在这种情况下,根据更新频率,文件版本数可能会无限增....

一文彻底理解Apache Hudi的多版本清理服务
文章 2021-08-24 来自:开发者社区

技术干货|一文彻底理解Apache Hudi的清理服务

Apache Hudi与Apache Pulsar联合Meetup杭州站来啦!将于2021年8月28日(本周六)13:30,在杭州正式召开,你准备好了吗?戳链接即可免费报名速来报名|Apache Hudi x Pulsar Meetup杭州站火爆来袭,实践干货就等你来Apache Hudi提供了MVCC并发模型,保证写入端和读取端之间快照级别隔离。在本篇博客中我们将介绍如何配置来管理多个文件版本....

技术干货|一文彻底理解Apache Hudi的清理服务

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

产品推荐

Apache Spark 中国技术社区

阿里巴巴开源大数据技术团队成立 Apache Spark 中国技术社区,定期推送精彩案例,问答区数个 Spark 技术同学每日在线答疑,只为营造 Spark 技术交流氛围,欢迎加入!

+关注
相关镜像