京公网安备 11010802034615号
经营许可证编号:京B2-20210330
支持向量机(SVM)理论总结系列.线性可分(附带R程序案例:用体重和心脏重量来预测一只猫的性别)
1.名词解释
支持向量机中的机:在机器学习领域,常把一些算法看做一个机器,如分类机(也叫作分类器)
2.问题描述
空间中有很多已知类别的点,现在想用一个面分开他们,并能对未知类别的点很好的识别类别。
3.算法思想
由问题描述可知,现在算法要解决两个问题:
找到一个平面,可以很好的区分不同类别的点,即使分类器的训练误差小,线性可分时要求训练误差为0。
很好的识别未知类别样本的类别,即多大程度上信任该分类器在未知样本上分类的效果。
令满足以上两点的超平面方程为:

图1 画图展示

4.公式推导
这里接着上一步,公式推导如何求w和b,下图2所示。
图2 公式推导

5.程序实现(案例)
案例介绍:用体重和心脏重量来预测一只猫的性别。
#数据集来自MASS包的cats数据集
#下面的程序将实现用体重和心脏重量来预测一只猫的性别
library(e1071)
data(cats,package="MASS")
summary(cats)
inputData=data.frame(cats[, c (2,3)], Sex= as.factor(cats$Sex))
train=inputData[1:108,]#训练集
test=inputData[109:144,]#测试集
#初步建模
x=train[,-3]
y=train[,3]
#核函数选择高斯核函数
model1=svm(x,y,kernel='radial',gamma=if(is.vector(x)) 1 else1/ncol(x))
#计算训练误差,结果显示有14个样本类别错误
z=test[,-3]
zy=test[,3]
zy=as.integer(zy)
pred1=predict(model1,x)
table(pred1,y)
#优化模型
attach(train)#将数据集train按列单独确认为向量
type=c("C-classification","nu-classification","one-classification")
kernel=c("linear","polynomial","radial","sigmoid")
pred2=array(0,dim=c(108,3,4))
accuracy=matrix(0,3,4)
yy=as.integer(y)
for(i in 1:3)
{
for(j in 1:4)
{
pred2[,i,j]=predict(svm(x,y,type=type[i],kernel=kernel[j]),x)
if(i>2) accuracy[i,j]=sum(pred2[,i,j]!=1)
else accuracy[i,j]=sum(pred2[,i,j]!=yy)
}
}
#12种组合算法在训练集上的误差
wrong=matrix(0,3,4)
for(i in 1:3)
{
for(j in 1:4)
{
wrong[i,j]=mean(yy != pred2[,i,j])#错误率占比
}
}
#选择训练集上误差最小的三种组合,计算在测试集上的误差,三种组合在训练集上的错误率分别为0.241,0.259,0.278;三种组合分别是nu-classification+radial、C-classification+linear组合和C-classification+radial组合。
pred3=array(0,dim=c(108,3,4))
for(i in 1:3)
{
for(j in 1:4)
{
pred3[,i,j]=predict(svm(x,y,type=type[i],kernel=kernel[j]),z)
if(i>2) accuracy[i,j]=sum(pred3[,i,j]!=1)
else accuracy[i,j]=sum(pred3[,i,j]!=yy)
}
}
mean(zy != pred3[,2,3])
mean(zy != pred3[,1,1])
mean(zy != pred3[,1,3])
#计算结果分别为0.417,0,0数据分析师培训
#在测试集上错误率为0的两种算法分别是C-classification+linear组合和C-classification+radial组合。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-08-21在数据分析与数据可视化工作中,直方图是展示数据分布特征、离散程度、集中区间的核心图表,能够直观呈现数值数据的频次分布规律 ...
2026-08-20在数据分析领域有一句核心准则:垃圾数据进,垃圾数据出。数据清洗是数据分析、数据建模、数据可视化之前的必经前置工序,也是保 ...
2026-08-20 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-08-20在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19在零售行业大数据分析与精细化运营领域,纸尿裤旁摆放啤酒是最经典、最具代表性的商业案例。两种看似毫无关联的商品,一个是婴幼 ...
2026-08-19 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-08-19在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当导致 ...
2026-08-18在数据分析、业务评价、产品评级、用户分层与综合决策场景中,单一指标往往无法全面、客观地评价事物整体水平。现实中的评价对象 ...
2026-08-18在数理统计、假设检验、数据分析与机器学习领域中,卡方分布(χ²分布)是继正态分布、t分布之后最重要的连续型概率分布之一。 ...
2026-08-17在Python数据清洗、文本校验、账号密码规则校验、脏数据过滤、字符串规整化处理中,正则表达式是最高效、最常用的文本匹配工具。 ...
2026-08-17 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-08-17手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13在数据统计分析与数据清洗工作中,箱线图是一种简洁高效、客观性强的数据可视化图表,能够直观呈现数据集的分布特征、离散程度和 ...
2026-08-13 很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视 ...
2026-08-13在自动化办公、数据采集、定时统计、日志清理、系统监控等场景中,程序往往需要按照固定时间间隔重复执行指定任务,这种运行机制 ...
2026-08-12