Spark学习之基于MLlib的机器学习

1. 机器学习算法尝试根据训练数据(training data)使得表示算法行为的数学目标最大化,并以此来进行预测或作出决定。

2. MLlib完成文本分类任务步骤:

(1)首先用字符串RDD来表示你的消息

(2)运行MLlib中的一个特征提取(feature extraction)算法来把文本数据转换为数值特征(适合机器学习算法处理);该操作会返回一个向量RDD。

(3)对向量RDD调用分类算法(比如逻辑回归);这步会返回一个模型对象,可以使用该对象对新的数据点进行分类。

(4)使用MLlib的评估函数在测试数据集上评估模型。

3. MLlib包含的主要数据类型:

  • Vector
  • LabeledPoint
  • Rating
  • 各种Model类

4. 操作向量

  • 向量有两种:稠密向量和稀疏向量

    • 稠密向量:把所有维度的值存放在一个浮点数数组中
    • 稀疏向量:只把各维度的非零值存储下来
    • 优先考虑稀疏向量,也是关键的优化手段
  • 创建向量的方式在各语言上有一些细微差别

5. 算法

  • 特征提取

    • TF-IDF(词频——逆文档频率)使用用来从文本文档(例如网页)中生成特向量的简单方法。
    • MLlib用两个算法来计算TF-IDF:Hashing和IDF,都在mllib.feature包内。
    • 缩放,大多数要考虑特征向量中各元素的幅值,并且在特征缩放调整为平等对待时表现最好。
    • 正规化,在准备输入数据时,把向量正规化为长度1。使用Normalizer类可以实现。
    • Word2Vec是一个基于神经网络的文本特征算法,可以用来将数据传给许多下游算法。
  • 统计
  • 分类和归类
    • 分类与回归是监督学习的两种形式。
    • 监督学习是指算法尝试使用有标签的训练数据根据对象的特征预测结果。
    • 在分类中,预测出的变量是离散的。
    • 在回归中,预测出的变量是连续的。
    • MLlib中包含许多分类与回归算法:如简单的线性算法以及决策树和森林算法。
  • 聚类
    • 聚类算法是一种无监督学习任务,用于将对象分到具有高度相似性的聚类中。
    • 聚类算法主要用于数据探索(查看一个新数据集是什么样子)以及异常检测(识别与任意聚类都相聚较远的点)。
    • MLlib中包含两个聚类中流行的K-means算法,以及一个叫做K-means||的变种,可以提供为并行环境提供更好的初始化策略。
  • 协同过滤与推荐
    • 协同过滤是一种根据用户对各种产品的交互与评分来推荐新产品的推荐系统技术。
    • 交替最小二乘(ALS),会为每个用户和产品都设一个特征向量,这样用户向量和产品向量的点积就接近于他们的得分。
  • 降维
    • 主成分分析(PCA)

      • PCA会把特征映射到低位空间,让数据在低维空间表示的方差最大化,从而忽略一些无用的维度。
      • 要计算这种映射,我们要构建出正规化的相关矩阵,并使用这个矩阵的奇异向量和奇异值。
      • 与最大的一部分奇异值相对应的奇异向量可以用来重建原始数据的主要成分。
//Scala中的PCA

import org.apache.spark.mllib.linalg.Matrix
import org.apache.spark.mllib.linalg.distributed.RowMatrix val points:RDD[Vector]=//...
val mat:RowMatrix = new RowMatrix(points)
val pc:Matrix = mat.computerPrincipalComponents(2) //将点投影到低维空间中
val projected = mat.nultiply(pc).rows //在投影出的二维数据上训练k-means模型
val model = KMeans.train(projected,10)
  • 降维

    • 奇异值分解

      • MLlib也提供底层的奇异值分解(简称SVD)原语。

最新文章

  1. 用freemarker定义宏实现自定义公用控件
  2. Repeater控件使用中的一些小问题
  3. cocos2dx的build_win32.dat出现问题以及install-template-msvc.dat出现.js没有脚本引擎
  4. HTML 父元素与子元素之间的margin-top问题
  5. Verilog HDL那些事_建模篇笔记(实验一,实验二)
  6. ecos内核概览--bakayi译
  7. Jetty使用
  8. shell之“>/dev/null 2>&1” 详解(转)
  9. mysql 监控 大批量的插入,删除,和修改
  10. Windows Phone开发(25):启动器与选择器之WebBrowserTask
  11. DP Leetcode - Maximum Product Subarray
  12. Grunt和Gulp构建工具在Visual Studio 2015中的高效的应用
  13. JNI调用问题(部分机型崩溃)
  14. C语言字符数组作业
  15. 浏览器开发者工具console
  16. 发现电脑上装着liteide,就用golang做一个TCP通讯测试(支持先启动client端和断线重连)
  17. OpenResty安装使用教程(CentOS 6)
  18. linux配置防火墙和重启防火墙
  19. lsb隐写
  20. vagrant up connection time out

热门文章

  1. 升级iOS 9之前的注意事项
  2. Python爬虫开发【第1篇】【Scrapy shell】
  3. File to byte[] in Java
  4. Delphi XE10调用WebService服务获取图片验证码
  5. CentOS7.2 设置GRUB2引导界面分辨率
  6. js用法2
  7. inserting a large number of records with SQLiteStatement.
  8. ConfigParser模块用法
  9. 常见电商项目的数据库表设计(MySQL版)
  10. window切换Java版本原因