阿里云文档 2025-06-09

用户画像分析案例同步数据-基于新版数据开发和Spark计算资源

本文将介绍如何创建HttpFile和MySQL数据源以访问用户信息和网站日志数据,配置数据同步链路将这些数据同步到在环境准备阶段创建的OSS存储中,并通过创建Spark外表解析OSS中存储的数据。通过查询验证数据同步结果,确认是否完成整个数据同步操作。

阿里云文档 2025-05-14

用户画像分析案例环境准备-基于新版数据开发和Spark计算资源

本教程以用户画像为例,在华东2(上海)地域演示如何使用DataWorks完成数据同步、数据加工和质量监控的全流程操作。为了确保您能够顺利完成本教程,您需要准备教程所需的EMR Serverless Spark空间、DataWorks工作空间,并进行相关的环境配置。

阿里云文档 2025-01-23

表格存储结合Spark流批处理实现一体化存储和计算的准备工作

本文介绍表格存储结合Spark流批处理实现一体化存储和计算场景的环境准备和数据准备工作。

文章 2024-05-26 来自:开发者社区

【指标计算】Spark 计算指定用户与其他用户购买的相同商品

@[toc] 需求说明 计算某一个指定用户与其他用户购买的共同商品,假设用户 user01 购买了商品 1、2、3,那么需要找出其他购买过商品 1 或 2 或 3 的用户。 需求分析 1.指定用户 获取指定用户所购买的商品 2.其他用户 判断其他用户所购买的商品是否被指定用户购买 需求实现 获取指定用户 user01 与其他用户购买过的相同商品。 import o...

【指标计算】Spark 计算指定用户与其他用户购买的相同商品
阿里云文档 2023-11-15

如何通过ACK Serverless创建Spark计算任务

在ACK Serverless集群中,您可以按需按量创建Pod。当Pod结束后停止收费,无需为Spark计算任务预留计算资源,从而摆脱集群计算力不足和扩容的烦扰,同时结合抢占式实例可以降低任务的计算成本。本文主要为您介绍如何通过ACK Serverless按需创建Spark计算任务。

文章 2023-02-09 来自:开发者社区

五、【计算】Spark原理与实践(下) | 青训营笔记

 引言学习的最大理由是想摆脱平庸,早一天就多一份人生的精彩;迟一天就多一天平庸的困扰。 热爱写作,愿意让自己成为更好的人............铭记于心✨我唯一知道的,便是我一无所知✨三、SparkSQL:1 名词解析DataFrame: 是一种以RDD为基础的分布式数据集, 被称为SchemaRDDCatalyst:SparkSQL核心模块,主要是对执行过程中的执行计划进行处理和优化DataS....

五、【计算】Spark原理与实践(下) | 青训营笔记
问答 2023-01-15 来自:开发者社区

adb做数仓 做计算 是基于本身的计算能力还是基于spark?

adb做数仓 做计算 是基于本身的计算能力还是基于spark?

问答 2023-01-09 来自:开发者社区

如何计算spark中的数据集,在加入内存中的大小

如题,数据在磁盘中,一般因为压缩等原因,在加载到内存中,完全展开以后,数据会膨胀很多,为了更好的利用内存,和调整相应参数,如何准确获取到,或者能预估出数据集在内存中的大小 当前尝试使用创建df.cache.count,然后通过执行计划获取数据集大小 val bytes = spark.sessionState.executePlan(df.queryExecution.logical).opti....

问答 2022-08-17 来自:开发者社区

流式计算 Spark Streaming 如何应treaming 如何应用?

流式计算 Spark Streaming 如何应用?

问答 2022-06-13 来自:开发者社区

当把仅有确定性计算的 Spark Streaming 和 Flink 进行对比时二者的不同点有哪些?

当把仅有确定性计算的 Spark Streaming 和 Flink 进行对比时二者的不同点有哪些?

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

Apache Spark 中国技术社区

阿里巴巴开源大数据技术团队成立 Apache Spark 中国技术社区,定期推送精彩案例,问答区数个 Spark 技术同学每日在线答疑,只为营造 Spark 技术交流氛围,欢迎加入!

+关注