• 技术文章 >后端开发 >Python教程

    Python语言实现机器学习的K-近邻算法

    2016-06-06 11:18:55原创654
    写在前面

    额、、、最近开始学习机器学习嘛,网上找到一本关于机器学习的书籍,名字叫做《机器学习实战》。很巧的是,这本书里的算法是用Python语言实现的,刚好之前我学过一些Python基础知识,所以这本书对于我来说,无疑是雪中送炭啊。接下来,我还是给大家讲讲实际的东西吧。

    什么是K-近邻算法?

    简单的说,K-近邻算法就是采用测量不同特征值之间的距离方法来进行分类。它的工作原理是:存在一个样本数据集合,也称作训练样本集,并且样本集中每个数据都存在标签,即我们知道样本集中每一数据与所属分类的对应关系,输入没有标签的新数据之后,将新数据的每个特征与样本集中数据对应的特征进行比较,然后算法提取出样本集中特征最相似数据的分类标签。一般来说,我们只选择样本数据集中前k个最相似的数据,这就是K-近邻算法名称的由来。

    提问:亲,你造K-近邻算法是属于监督学习还是无监督学习呢?

    使用Python导入数据

    从K-近邻算法的工作原理中我们可以看出,要想实施这个算法来进行数据分类,我们手头上得需要样本数据,没有样本数据怎么建立分类函数呢。所以,我们第一步就是导入样本数据集合。

    建立名为kNN.py的模块,写入代码:

     from numpy import *
     import operator
     
     def createDataSet():
       group = array([[1.0,1.1],[1.0,1.0],[0,0],[0,0.1]])
       labels = ['A','A','B','B']
       return group, labels
    
    

    代码中,我们需要导入Python的两个模块:科学计算包NumPy和运算符模块。NumPy函数库是Python开发环境的一个独立模块,大多数Python版本里没有默认安装NumPy函数库,因此这里我们需要单独安装这个模块。

    下载地址:http://sourceforge.net/projects/numpy/files/

    有很多的版本,这里我选择的是numpy-1.7.0-win32-superpack-python2.7.exe。

    实现K-近邻算法

    K-近邻算法的具体思想如下:

    (1)计算已知类别数据集中的点与当前点之间的距离

    (2)按照距离递增次序排序

    (3)选取与当前点距离最小的k个点

    (4)确定前k个点所在类别的出现频率

    (5)返回前k个点中出现频率最高的类别作为当前点的预测分类

    Python语言实现K-近邻算法的代码如下:

     # coding : utf-8
     from numpy import *
     import operator 
     import kNN
     group, labels = kNN.createDataSet()
     def classify(inX, dataSet, labels, k):
       dataSetSize = dataSet.shape[0] 
       diffMat = tile(inX, (dataSetSize,1)) - dataSet
       sqDiffMat = diffMat**2
       sqDistances = sqDiffMat.sum(axis=1)
       distances = sqDistances**0.5
       sortedDistances = distances.argsort()
       classCount = {}
       for i in range(k):
         numOflabel = labels[sortedDistances[i]]
         classCount[numOflabel] = classCount.get(numOflabel,0) + 1
       sortedClassCount = sorted(classCount.iteritems(), key=operator.itemgetter(1),reverse=True)
       return sortedClassCount[0][0]
     my = classify([0,0], group, labels, 3)
     print my
    
    

    运算结果如下:

    输出结果是B:说明我们新的数据([0,0])是属于B类。

    代码详解

    相信有很多朋友们对上面这个代码有很多不理解的地方,接下来,我重点讲解几个此函数的关键点,以方便读者们和我自己回顾一下这个算法代码。

    classify函数的参数:

    inX:用于分类的输入向量
    dataSet:训练样本集合
    labels:标签向量
    k:K-近邻算法中的k
    shape:是array的属性,描述一个多维数组的维度

    tile(inX, (dataSetSize,1)):把inX二维数组化,dataSetSize表示生成数组后的行数,1表示列的倍数。整个这一行代码表示前一个二维数组矩阵的每一个元素减去后一个数组对应的元素值,这样就实现了矩阵之间的减法,简单方便得不让你佩服不行!

    axis=1:参数等于1的时候,表示矩阵中行之间的数的求和,等于0的时候表示列之间数的求和。

    argsort():对一个数组进行非降序排序

    classCount.get(numOflabel,0) + 1:这一行代码不得不说的确很精美啊。get():该方法是访问字典项的方法,即访问下标键为numOflabel的项,如果没有这一项,那么初始值为0。然后把这一项的值加1。所以Python中实现这样的操作就只需要一行代码,实在是很简洁高效。

    后话

    K-近邻算法(KNN)原理以及代码实现差不多就这样了,接下来的任务就是更加熟悉它,争取达到裸敲的地步。

    以上所述上就是本文的全部内容了,希望大家能够喜欢。

    声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn核实处理。
    专题推荐:Python K-近邻算法
    上一篇:六个窍门助你提高Python运行效率 下一篇:Python函数返回值实例分析
    PHP编程就业班

    相关文章推荐

    • 带你一起解读Python多线程• Python学习之解析Flask运行原理(图文详解)• 简单剖析一下Python的format的用法• python实现用经纬度点坐标读取DEM中的高程信息(实例详解)• 分享10个有趣且实用的Python模块,看看他们的功能吧!

    全部评论我要评论

  • 取消发布评论发送
  • 1/1

    PHP中文网