CSDN:白马负金羁 在R中,可以使用e1071软件包所提供的各种函数来完成基于支持向量机的数据分析与挖掘任务。请在使用相关函数之前,安装并正确引用e1071包。该包中最重要的一个函数就是用来建立支持向量机模型的svm()函数。我们将结合后面的例子来演示它的用法。 下面这个例子中的数据源于1936年费希尔发表的一篇重要论文。彼时他收集了三种鸢尾花(分别标记为setosa、versicolor和virginica)的花萼和花瓣数据。包括花萼的长度和宽度,以及花瓣的长度和宽度。我们将根据这四个特征来建立支持向量机模型从而实现对三种鸢尾花的分类判别任务。
在正式建模之前,我们也可以通过一个图型来初步判定一下数据的分布情况,为此在R中使用如下代码来绘制(仅选择Petal.Length和Petal.Width这两个特征时)数据的划分情况。 [plain] view plain copy
函数svm()在建立支持向量机分类模型时有两种方式。第一种是根据既定公式建立模型,此时的函数使用格式为 [plain] view plain copy
然后我们可以使用下面的代码来对模型进行图形化展示,其执行结果如图14-14所示。 [plain] view plain copy
在使用第一种格式建立模型时,若使用数据中的全部特征变量作为模型特征变量时,可以简要地使用“Species~.”中的“.”代替全部的特征变量。例如下面的代码就利用了全部四种特征来对三种鸢尾花进行分类。 [plain] view plain copy
若要显示模型的构建情况,使用summary()函数是一个不错的选择。来看下面这段示例代码及其输出结果。 通过summary函数可以得到关于模型的相关信息。其中,SVM-Type项目说明本模型的类别为C分类器模型;SVM-Kernel项目说明本模型所使用的核函数为高斯内积函数且核函数中参数gamma的取值为0.25;cost项目说明本模型确定的约束违反成本为l。而且我们还可以看到,模型找到了51个支持向量:第一类包含有8个支持向量,第二类包含有22个支持向量,第三类包含21个支持向量。最后一行说明模型中的三个类别分别为setosa、versicolor和virginica。 第二种使用svm()函数的方式则是根据所给的数据建立模型。这种方式形式要复杂一些,但是它允许我们以一种更加灵活的方式来构建模型。它的函数使用格式如下(注意我们仅列出了其中的主要参数)。 [plain] view plain copy
核函数有两种主要类型:局部性核函数和全局性核函数,高斯核函数是一个典型的局部性核函数,而多项式核函数则是一个典型的全局性核函数。局部性核函数仅仅在测试点附近小领域内对数据点有影响,其学习能力强、泛化性能较弱;而全局性核函数则相对来说泛化性能较强、学习能力较弱。
在使用第二种格式建立模型时,不需要特别强调所建立模型的形式,函数会自动将所有输入的特征变量数据作为建立模型所需要的特征向量。在上述过程中,确定核函数的gamma系数时所使用的代码所代表的意思是:如果特征向量是向量则gamma值取l,否则gamma值为特征向量个数的倒数。 在利用样本数据建立模型之后,我们便可以利用模型来进行相应的预测和判别。基于由svm()函数建立的模型来进行预测时,可以选用函数predict()来完成相应工作。在使用该函数时,应该首先确认将要用于预测的样本数据,并将样本数据的特征变量整合后放入同一个矩阵。来看下面这段示例代码。 通常在进行预测之后,还需要检查模型预测的准确情况,这时便需要使用函数table()来对预测结果和真实结果做出对比展示。从上述代码的输出中,可以看到在模型预测时,模型将所有属于setosa类型的鸢尾花全部预测正确;模型将属于versicolor类型的鸢尾花中有48朵预测正确,但将另外两朵错误地预测为virginica类型;同样,模型将属于virginica类型的鸢尾花中的48朵预测正确,但也将另外两朵错误地预测为versicolor类型。
由于我们要处理的是一个分类问题。所以分类决策最终是经由一个sign(?)函数来完成的。从上面的输出中可以看到,对于样本数据4而言,标签setosa/versicolor对应的值大于0,因此属于setosa类别;标签setosa/virginica对应的值同样大于0,以此判定也属于setosa;在二分类器versicolor/virginica中对应的决策值大于0,判定属于versicolor。所以,最终样本数据4被判定属于setosa。依据同样的罗辑,我们还可以根据决策值的符号来判定样本77和样本78,分别是属于versicolor和virginica类别的。 为了对模型做进一步分析,可以通过可视化手段对模型进行展示,下面给出示例代码。结果如图14-15所示。可见,通过plot()函数对所建立的支持向量机模型进行可视化后,所得到的图像是对模型数据类别的一个总体观察。图中的“+”表示的是支持向量,圆圈表示的是普通样本点。 [plain] view plain copy
在图14-15中我们可以看到,鸢尾花中的第一种setosa类别同其他两种区别较大,而剩下的versicolor类别和virginica类别却相差很小,甚至存在交叉难以区分。注意,这是在使用了全部四种特征之后仍然难以区分的。这也从另一个角度解释了在模型预测过程中出现的问题,所以模型误将2朵versicolor 类别的花预测成了virginica 类别,而将2朵virginica 类别的花错误地预测成了versicolor 类别,也就是很正常现象了。
|
|
来自: 黄健a00qp4p45m > 《计算机文摘》