文章 2023-11-01 来自:开发者社区

Spark笔记(pyspark)2

6.SparkSQL 数据清洗API1.去重方法 dropDuplicates功能:对DF的数据进行去重,如果重复数据有多条,取第一条2.删除有缺失值的行方法 dropna功能:如果数据中包含null,通过dropna来进行判断,符合条件就删除这一行数据3.填充缺失值数据 fillna功能:根据参数的规则,来进行null的替换7.DataFrame数据写出spark.read.format()和....

Spark笔记(pyspark)2
文章 2023-11-01 来自:开发者社区

Spark笔记(pyspark)1

Spark是什么:Spark是基于内存的迭代式计算引擎1、基本概念RDD:是Resillient Distributed Dataset(弹性分布式数据集)的简称,是分布式内存的一个抽象概念,提供了一种高度受限的共享内存模型DAG:是Directed Acyclic Graph(有向无环图)的简称,反映RDD之间的依赖关系Executor:是运行在工作节点(WorkerNode)的一个进程,负责....

Spark笔记(pyspark)1

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

Apache Spark 中国技术社区

阿里巴巴开源大数据技术团队成立 Apache Spark 中国技术社区,定期推送精彩案例,问答区数个 Spark 技术同学每日在线答疑,只为营造 Spark 技术交流氛围,欢迎加入!

+关注