文章 2017-05-02 来自:开发者社区

《循序渐进学Spark》一2.2 Spark程序模型

本节书摘来自华章出版社《循序渐进学Spark》一书中的第2章,第2.2节,作者 小象学院 杨 磊,更多章节内容可以访问云栖社区“华章计算机”公众号查看。 2.2 Spark程序模型 下面给出一个经典的统计日志中ERROR的例子,以便读者直观理解Spark程序模型。 1)SparkContext中的textFile函数从存储系统(如HDFS)中读取日志文件,生成file变量。 scala>.....

文章 2017-05-02 来自:开发者社区

Apache Spark机器学习3.4 模型估计

3.4 模型估计 在上一节完成了特征集选择,接下来需要评估模型参数。我们可以使用MLlib或者R语言进行评估,并准备分布式的计算。 为了简化操作,我们使用Databricks的作业特性。具体来讲,在Databricks环境中,前往“Job”菜单,创建作业,如下图所示:   接着,用户可以选择notebook来运行,指定集群并且调度作业。一旦作业被调度,用户可以监视作业的执行,并收集结果。...

文章 2017-05-01 来自:开发者社区

Apache Spark机器学习3.5 模型评估

3.5 模型评估 在上一节,我们完成了模型估计任务。现在,对我们来讲是时候评估模型是否满足模型质量标准,以决定我们进行下一步的结果解释还是回到前面的阶段改善模型。 本节,我们将使用均方根误差(Root-Mean-Square Error,RMSE)和受试者工作特征(Receiver Operating Characteristic,ROC)曲线来评估我们模型的质量。计算RMSE和ROC曲线,我.....

文章 2017-02-13 来自:开发者社区

【Spark Summit EU 2016】使用Redis模型为Spark-ML加速

更多精彩内容参见云栖社区大数据频道https://yq.aliyun.com/big-data;此外,通过Maxcompute及其配套产品,低廉的大数据分析仅需几步,详情访问https://www.aliyun.com/product/odps。 本讲义出自Shay Nativ与Dvir Volk在Spark Summit EU上的演讲,主要介绍了支持网络、可基于内存也可持久化的日志型、开源的K....

文章 2017-02-13 来自:开发者社区

【Spark Summit EU 2016】基于SparkML整体模型的预测服务,看每天10亿张机票的价格如何变化

更多精彩内容参见云栖社区大数据频道https://yq.aliyun.com/big-data;此外,通过Maxcompute及其配套产品,低廉的大数据分析仅需几步,详情访问https://www.aliyun.com/product/odps。 本讲义出自Josef Habdank在Spark Summit EU上的演讲,主要介绍了对于大规模数据科学的整体模型方法,基于DataBricks的每....

文章 2016-12-21 来自:开发者社区

Spark机器学习7·降维模型(scala&python)

Spark机器学习 PCA(主成分分析法,Principal Components Analysis) SVD(奇异值分解法,Singular Value Decomposition) http://vis-www.cs.umass.edu/lfw/lfw-a.tgz 0 运行环境 export SPARK_HOME=/Users/erichan/Garden/spark-1.5.1-bin...

文章 2016-12-21 来自:开发者社区

Spark机器学习4·分类模型(spark-shell)

Spark机器学习 线性模型 逻辑回归--逻辑损失(logistic loss) 线性支持向量机(Support Vector Machine, SVM)--合页损失(hinge loss) 朴素贝叶斯(Naive Bayes) 决策树 0 准备数据 kaggle2.blob.core.windows.net/competitions-data/kaggle/3526/train.t...

文章 2016-12-21 来自:开发者社区

Spark机器学习5·回归模型(pyspark)

Spark机器学习 分类模型的预测目标是:类别编号 回归模型的预测目标是:实数变量 回归模型种类 线性模型 最小二乘回归模型 应用L2正则化时--岭回归(ridge regression) 应用L1正则化时--LASSO(Least Absolute Shrinkage and Selection Operator) 决策树 不纯度度量方法:方差 0 准备数据 archive...

文章 2016-12-21 来自:开发者社区

Spark机器学习6·聚类模型(spark-shell)

Spark机器学习 K-均值(K-mean)聚类 目的:最小化所有类簇中的方差之和 类簇内方差和(WCSS,within cluster sum of squared errors) fuzzy K-means 层次聚类(hierarchical culstering) 凝聚聚类(agglomerative clustering) 分列式聚类(divisive clustering...

文章 2016-08-28 来自:开发者社区

spark概述与编程模型

spark快的原因1.内存计算 2.DAG spark shell已经初始化好了SparkContext,直接用sc调用即可 lineage 血统 RDD wide and narrow dependencies 窄依赖每个 RDD partition最多被一个子RDD partirion依赖 /sbin(system binary)放的都是涉及系统管理的命令。有些系统里面,普...

spark概述与编程模型

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

Apache Spark 中国技术社区

阿里巴巴开源大数据技术团队成立 Apache Spark 中国技术社区,定期推送精彩案例,问答区数个 Spark 技术同学每日在线答疑,只为营造 Spark 技术交流氛围,欢迎加入!

+关注