数据清洗是整个数据分析过程中一个非常重要的环节。数据清洗的目的有两个,第一是通过清洗让数据可用。第二是让数据变的更适合进行后续的分析工作。本篇文章将介绍几种简单的使用R进行数据清洗的方法。
读取并创建数据表
首先将数据读取到R中,并创建名为loan的数据表。后面我们将对这个数据表进行清洗。
#读取并创建数据表
loan=data.frame(read.csv('loan.csv',header = 1))
使用head函数查看数据表的前5行。
#查看数据表前5行
head(loan)
数据清洗
重复值
使用duplicated函数查看数据表中的用户ID列是否存在重复值,duplicated函数返回该字段每一行的检查结果,重复的标记为TURE,不重复的值标记为FALSE。在下面的结果中可以看到数据表的用户ID列最后四个值为重复值。
#查看特定列是否有重复
duplicated(loan$member_id)
[1] FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE
[23] FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE TRUE TRUE TRUE TRUE
对于包含重复值的数据表,可以使用unique函数提取数据表中的唯一值,并用唯一值覆盖原有数据,达到去除重复值的目的。下面的代码提取了loan数据表中的唯一值,并重新赋给loan数据表。此时loan数据表中就不包含重复值了。
#删除重复值,返回唯一值列表
loan=unique(loan)
去除完重复值后,再次使用duplicated函数查看,返回的结果中都为FALSE,已经没有重复值了。
#查看重复值
duplicated(loan$member_id)
[1] FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE
[23] FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE
查找空值
使用is.na函数查看数据表中的空值,和重复值一样,空值在结果中显示为TURE,非空值显示为FALSE。下面是对loan数据表检查空值的代码和结果。
#查找数据表中的空值
head(is.na(loan),n = 10)
除了对数据表查看空值以外,还可以对表中特定的列检查空值,在is.na函数中输入表和列的名称,就会看到该列中空值的情况,TRUE为空值,FALSE为非空值。
#查看特定列中的空值
is.na(loan$loan_amnt)
[1] FALSE FALSE FALSE FALSE FALSE FALSE TRUE FALSE FALSE FALSE FALSE FALSE TRUE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE
[23] TRUE FALSE FALSE FALSE FALSE FALSE FALSE FALSE
填充空值
对于数据表中的空值,有两种处理方法,第一种是用0进行填充,第二种是删除包含空值的行。下面是第一种方法,将loan表中的空值填充为0.
#将空值填充为0
loan[is.na(loan)] <- 0
[/code]
第二种方法使用 删除loan表中包含有空值的行。
[code lang="r"]
#删除空值所在行
loan<-na.omit(loan)
[/code]
<h2>
大小写转换</h2>
英文字母的大小写和字符间的空格是影响数据统计的一个常见原因。例如下面我们使用table函数对数据表按贷款状态进行汇总时,相同的贷款状态由于大小写和空格被分割成多种状态。造成统计数据不可用。下面我们对这个字段进行大小写转换和去除空格的清洗。
#按贷款状态进行汇总
table(loan$loan_status)
Fully Paid charged off Charged Off Charged Off Current fully paid fully Paid Fully paid Fully Paid
1 1 8 1 1 2 1 1 15
将英文字母转换为小写的函数是tolower,下面的代码中我们将贷款状态列统一转化为小写字母,然后重复赋给数据表中的贷款状态列。
#将贷款状态转换为小写
loan$loan_status=tolower(loan$loan_status)
转化完成后,再次使用table函数按贷款状态进行汇总,下面下面的结果中可以看到分类从之前的8个减少到了4个,并且的分类都为小写字母。下面我们在继续进行空格清洗。
#按贷款状态进行汇总
table(loan$loan_status)
fully paid charged off charged off current fully paid
1 9 1 1 19
去除两侧空格
去除字符间的空格比大小写转换要复杂一些,首先我们将需要去除空格的列单独拿出来
#提取贷款状态列
loan_status=as.vector(loan$loan_status)
然后使用trim函数去除该列中的空格,trim函数在raster包中,因此需要先安装raster的包。
#安装raster包
install.packages('raster')
安装完成后加载raster包。
#加载raster包
library(raster)
加载完raster包后,使用trim函数去除贷款状态字符中的空格。
#去除贷款状态字段中的空格
loan_s=trim(loan_status)
使用去除完空格的贷款状态覆盖数据表中原有的贷款状态列。
#覆盖原有贷款状态字段
loan$loan_status=loan_s
去除完空格后,再次按贷款状态进行汇总,结果从5个减少为3个,恢复正常。
#按贷款状态进行汇总
table(loan$loan_status)
charged off current fully paid
10 1 20
查看数据类型
使用typeof函数可以查看数据表中字段的数据类型,下面的代码对数据表中的用户收入字段进行数据类型查看,结果为double型。
#查看用户收入字段的数据类型
typeof(loan$annual_inc)
[1] "double"
更改数据类型
使用as.integer函数将用户收入字段的数据类型由double型转化为integer型。
#将用户收入字段更改为integer
loan$annual_inc=as.integer(loan$annual_inc)
转化后再次使用typeof函数查看数据类型,此时已经显示数据类型为integer。
#查看用户收入字段
typeof(loan$annual_inc)
[1] “integer”
数据预处理
数据分列
很多时候我们需要对一列数据进行分裂处理,在excel中直接使用分列功能就可以完成,在R中,使用strsplit函数也可以实现。首先将需要分列的列单独提取出来。这里我们需要对贷款期限进行分裂。
#提取贷款期限字段
term=as.vector(loan$term)
[1] ” 36 months” ” 60 months” ” 36 months” ” 36 months” ” 60 months” ” 36 months” ” 60 months” ” 36 months” ” 60 months” ” 60 months”
[11] ” 60 months” ” 36 months” ” 36 months” ” 36 months” ” 36 months” ” 36 months” ” 36 months” ” 36 months” ” 36 months” ” 36 months”
[21] ” 60 months” ” 36 months” ” 36 months” ” 36 months” ” 36 months” ” 36 months” ” 36 months” ” 60 months” ” 36 months” ” 36 months”
[31] ” 36 months” ” 60 months” ” 36 months” ” 36 months”
然后使用strsplit函数对贷款期限进行分列,分列的依据是空格。具体代码和分列的结果如下所示。
#使用空格对字段进行分裂
strsplit(term,' ')
[[1]]
[1] “” “36” “months”
[[2]]
[1] “” “60” “months”
[[3]]
[1] “” “36” “months”
除了分列以外,还可以对一个字段中的某些信息进行提取,并单独形成一列进行分析。下面我们对贷款日期中的月份进行提取,并合并到原数据表中。提取月份所使用的函数为substr。下面的代码中对贷款日期字段的4-6位进行提取,这部分对应着月信息。
#提取贷款日期字段中的月信息(4-6位)
month=substr(loan$issue_d,4,6)
#查看提取的月信息
month
[1] “Jun” “Sep” “Jun” “Apr” “Jun” “Jan” “May” “Dec” “Aug” “Mar” “Dec” “Aug” “Nov” “Jun” “Mar” “Jun” “Apr” “May” “Jul” “Feb” “Jun” “Jun”
[23] “Jun” “Mar” “Mar” “Sep” “Jun” “May” “Jun” “Dec” “Jun” “May” “Jun” “Dec”
将提取出来的月信息与原数据表合并,并查看前5行数据,从下面的结果中可以看出第一列是新增加的月信息。
#将月信息与原贷款表合并并查看前5行
head(cbind(month,loan))
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据分析在当今信息时代发挥着重要作用。单因素方差分析(One-Way ANOVA)是一种关键的统计方法,用于比较三个或更多独立样本组 ...
2025-04-25CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-25在当今数字化时代,数据分析师的重要性与日俱增。但许多人在踏上这条职业道路时,往往充满疑惑: 如何成为一名数据分析师?成为 ...
2025-04-24以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《刘静:10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda ...
2025-04-23大咖简介: 刘凯,CDA大咖汇特邀讲师,DAMA中国分会理事,香港金管局特聘数据管理专家,拥有丰富的行业经验。本文将从数据要素 ...
2025-04-22CDA持证人简介 刘伟,美国 NAU 大学计算机信息技术硕士, CDA数据分析师三级持证人,现任职于江苏宝应农商银行数据治理岗。 学 ...
2025-04-21持证人简介:贺渲雯 ,CDA 数据分析师一级持证人,互联网行业数据分析师 今天我将为大家带来一个关于用户私域用户质量数据分析 ...
2025-04-18一、CDA持证人介绍 在数字化浪潮席卷商业领域的当下,数据分析已成为企业发展的关键驱动力。为助力大家深入了解数据分析在电商行 ...
2025-04-17CDA持证人简介:居瑜 ,CDA一级持证人,国企财务经理,13年财务管理运营经验,在数据分析实践方面积累了丰富的行业经验。 一、 ...
2025-04-16持证人简介: CDA持证人刘凌峰,CDA L1持证人,微软认证讲师(MCT)金山办公最有价值专家(KVP),工信部高级项目管理师,拥有 ...
2025-04-15持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。在实际生活中,我们可能会 ...
2025-04-14在 Python 编程学习与实践中,Anaconda 是一款极为重要的工具。它作为一个开源的 Python 发行版本,集成了众多常用的科学计算库 ...
2025-04-14随着大数据时代的深入发展,数据运营成为企业不可或缺的岗位之一。这个职位的核心是通过收集、整理和分析数据,帮助企业做出科 ...
2025-04-11持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。 本次分享我将以教培行业为 ...
2025-04-11近日《2025中国城市长租市场发展蓝皮书》(下称《蓝皮书》)正式发布。《蓝皮书》指出,当前我国城市住房正经历从“增量扩张”向 ...
2025-04-10在数字化时代的浪潮中,数据已经成为企业决策和运营的核心。每一位客户,每一次交易,都承载着丰富的信息和价值。 如何在海量客 ...
2025-04-09数据是数字化的基础。随着工业4.0的推进,企业生产运作过程中的在线数据变得更加丰富;而互联网、新零售等C端应用的丰富多彩,产 ...
2025-04-094月7日,美国关税政策对全球金融市场的冲击仍在肆虐,周一亚市早盘,美股股指、原油期货、加密货币、贵金属等资产齐齐重挫,市场 ...
2025-04-08背景 3月26日,科技圈迎来一则重磅消息,苹果公司宣布向浙江大学捐赠 3000 万元人民币,用于支持编程教育。 这一举措并非偶然, ...
2025-04-07在当今数据驱动的时代,数据分析能力备受青睐,数据分析能力频繁出现在岗位需求的描述中,不分岗位的任职要求中,会特意标出“熟 ...
2025-04-03