阿里云文档 2025-06-27

用户画像分析案例同步数据-基于新版数据开发和Spark计算资源

本文将介绍如何创建HttpFile和MySQL数据源以访问用户信息和网站日志数据,配置数据同步链路将这些数据同步到在环境准备阶段创建的OSS存储中,并通过创建Spark外表解析OSS中存储的数据。通过查询验证数据同步结果,确认是否完成整个数据同步操作。

阿里云文档 2025-06-27

用户画像分析案例环境准备-基于新版数据开发和Spark计算资源

本教程以用户画像为例,在华东2(上海)地域演示如何使用DataWorks完成数据同步、数据加工和质量监控的全流程操作。为了确保您能够顺利完成本教程,您需要准备教程所需的EMR Serverless Spark空间、DataWorks工作空间,并进行相关的环境配置。

阿里云文档 2025-01-23

表格存储结合Spark流批处理实现一体化存储和计算的准备工作

本文介绍表格存储结合Spark流批处理实现一体化存储和计算场景的环境准备和数据准备工作。

阿里云文档 2023-11-15

如何通过ACK Serverless创建Spark计算任务

在ACK Serverless集群中,您可以按需按量创建Pod。当Pod结束后停止收费,无需为Spark计算任务预留计算资源,从而摆脱集群计算力不足和扩容的烦扰,同时结合抢占式实例可以降低任务的计算成本。本文主要为您介绍如何通过ACK Serverless按需创建Spark计算任务。

问答 2022-08-17 来自:开发者社区

流式计算 Spark Streaming 如何应treaming 如何应用?

流式计算 Spark Streaming 如何应用?

文章 2022-04-02 来自:开发者社区

大数据流式计算三种框架:Storm,Spark和Samza

许多分布式计算系统都可以实时或接近实时地处理大数据流。本文将对三种Apache框架分别进行简单介绍,然后尝试快速、高度概述其异同。 Apache Storm 在Storm中,先要设计一个用于实时计算的图状结构,我们称之为拓扑(topology)。这个拓扑将会被提交给集群,由集群中的主控节点(master node)分发代码,将任务分配给工作节点(worker node)执行。一个拓扑中包括sp.....

大数据流式计算三种框架:Storm,Spark和Samza
问答 2022-02-15 来自:开发者社区

Noxmobi系统使用流式计算Spark Streaming的目的是什么?

Noxmobi系统使用流式计算Spark Streaming的目的是什么?

问答 2022-02-15 来自:开发者社区

Noxmobi系统使用流式计算Spark Streaming的要求有哪些?

Noxmobi系统使用流式计算Spark Streaming的要求有哪些?

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

Apache Spark 中国技术社区

阿里巴巴开源大数据技术团队成立 Apache Spark 中国技术社区,定期推送精彩案例,问答区数个 Spark 技术同学每日在线答疑,只为营造 Spark 技术交流氛围,欢迎加入!

+关注