文章 2024-03-12 来自:开发者社区

最强指南!数据湖Apache Hudi、Iceberg、Delta环境搭建

1. 引入 作为依赖Spark的三个数据湖开源框架Delta,Hudi和Iceberg,本篇文章为这三个框架准备环境,并从Apache Spark、Hive和Presto的查询角度进行比较。主要分为三部分 准备单节点集群,包括:Hadoop,Spark,Hive,Presto和所有依赖项。 测试Delta,Hudi,Iceberg在更新,删除,时间旅行,Sc...

最强指南!数据湖Apache Hudi、Iceberg、Delta环境搭建
文章 2024-03-07 来自:开发者社区

图加速数据湖分析-GeaFlow和Apache Hudi集成

表模型现状与问题 关系模型自1970年由埃德加·科德提出来以后被广泛应用于数据库和数仓等数据处理系统的数据建模。关系模型以表作为基本的数据结构来定义数据模型,表为二维数据结构,本身缺乏关系的表达能力,关系的运算通过Join关联运算来处理。表模型简单且易于理解,在关系模型中被广泛使用。随着互联网信息技术的发展,处理的数据规模越来越大,大数据系统应运而生。表模型作为重要的数据模型依然被Spa...

图加速数据湖分析-GeaFlow和Apache Hudi集成
文章 2021-11-17 来自:开发者社区

从消息到数据湖:看 Apache RocketMQ、Hudi、Kyuubi 最新进展

上海的开发者小伙伴们,12 月 18 号,Apache RocketMQ & Apache Hudi & Apache Kyuubi (Incubating)三社区 Meetup 来了,打造最强消息传输、实时计算、数据入湖一体化解决方案专场。本场活动聚焦 Apache  RocketMQ 及 Hudi,Kyuubi 数据湖结合,帮助开发者能更好地应对业务挑战。活动将邀请....

从消息到数据湖:看 Apache RocketMQ、Hudi、Kyuubi 最新进展
文章 2020-10-21 来自:开发者社区

数据湖有新解!Apache Hudi 与 Apache Flink 集成

作者:王祥虎(Apache Hudi 社区) Apache Hudi 是由 Uber 开发并开源的数据湖框架,它于 2019 年 1 月进入 Apache 孵化器孵化,次年 5 月份顺利毕业晋升为 Apache 顶级项目。是当前最为热门的数据湖框架之一。 1. 为何要解耦 Hudi 自诞生至今一直使用 Spark 作为其数据处理引擎。如果用户想使用 Hudi 作为其数据湖框架,就必须在其平台技术....

数据湖有新解!Apache Hudi 与 Apache Flink 集成
文章 2020-07-31 来自:开发者社区

基于阿里云数据湖分析服务和Apache Hudi构建云上实时数据湖

1. 什么是实时数据湖 大数据时代数据格式的多样化,如结构化数据、半结构化数据、非结构化数据,传统数据仓库难以满足各类数据的存储,同时传统数仓已经难以满足上层应用如交互式分析、流式分析、ML等的多样化需求。而数仓T+1的数据延迟导致分析延迟较大,不利于企业及时洞察数据价值;同时随着云计算技术发展以及云上对象存储的廉价性,使得越来越多企业基于云来构建数据湖,而传统数据湖由于缺失ACID事务能力,导....

基于阿里云数据湖分析服务和Apache Hudi构建云上实时数据湖

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

产品推荐

Apache Spark 中国技术社区

阿里巴巴开源大数据技术团队成立 Apache Spark 中国技术社区,定期推送精彩案例,问答区数个 Spark 技术同学每日在线答疑,只为营造 Spark 技术交流氛围,欢迎加入!

+关注
相关镜像