Spark mllib k-means 聚合

栏目: 服务器 · 发布时间: 7年前

内容简介：K-Means算法是一种基于距离的聚类算法，采用迭代的方法，计算出K个聚类中心，把若干个点聚成K类。1. 输出4699

K-Means算法是一种基于距离的聚类算法，采用迭代的方法，计算出K个聚类中心，把若干个点聚成K类。

package com.immooc.spark

import org.apache.log4j.{Level, Logger}
import org.apache.spark.mllib.clustering.KMeans
import org.apache.spark.mllib.linalg.Vectors
import org.apache.spark.{SparkConf, SparkContext}

object KMeansTest {
  def main(args:Array[String]): Unit = {


    val conf = new SparkConf().setAppName("KMeansTest").setMaster("local[2]")
    val sc = new SparkContext(conf)

    Logger.getRootLogger.setLevel(Level.WARN)

    // 读取样本数据1，格式为LIBSVM format
    val data = sc.textFile("file:///Users/walle/Documents/D3/sparkmlib/kmeans_data.txt")
    val parsedData = data.map(s => Vectors.dense(s.split(' ').map(_.toDouble))).cache()

    // 新建KMeans聚类模型，并训练
    val initMode = "k-means||"
    val numClusters = 4
    val numIterations = 100
    val model = new KMeans().
      setInitializationMode(initMode).
      setK(numClusters).
      setMaxIterations(numIterations).
      run(parsedData)
    val centers = model.clusterCenters
    println("centers")
    for (i <- 0 to centers.length - 1) {
      println(centers(i)(0) + "\t" + centers(i)(1))
    }

    // 误差计算
    val WSSSE = model.computeCost(parsedData)
    println("Within Set Sum of Squared Errors = " + WSSSE)
  }
}

1. 输出

centers
9.05	9.05
0.05	0.05
9.2	9.2
0.2	0.2
Within Set Sum of Squared Errors = 0.03000000000004321

http://www.waitingfy.com/archives/4699

4699

以上就是本文的全部内容，希望本文的内容对大家的学习或者工作能带来一定的帮助，也希望大家多多支持码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络，本站转载出于传递更多信息之目的，版权归原作者或者来源机构所有，如转载稿涉及版权问题，请联系我们。

码农书籍

那些让文案绝望的文案

小马宋 / 北京联合出版公司 / 2015-10 / 45

什么文案60年前就在使用互联网思维？什么文案让一辆小车在崇尚大车的国度畅销不衰？什么文案让做文案的人产生“既生瑜何生亮”的绝望？没错，它是甲壳虫。远在上世纪五六十年代，这些文案让这辆不起眼的小车畅销不衰。它的文案风趣而又言之凿凿，它的文案机智而又无可辩驳。它充满自黑精神，善于借势时事热点，懂得乖巧卖萌，也是天生的段子手。为了让国内读者一睹这一......一起来看看《那些让文案绝望的文案》这本书的介绍吧!

码农工具

Spark mllib k-means 聚合

那些让文案绝望的文案

正则表达式在线测试

HEX HSV 转换工具

HSV CMYK 转换工具