在R中整理数据-CDA数据分析师官网

热线电话：13121318867

首页精彩阅读在R中整理数据

在R中整理数据

2017-05-23

在R中整理数据

原始数据一般分散杂乱，并含有缺失和错误值，因此在进行数据分析前首先要对数据进行整理。

一、首先，了解原始数据的结构。

可使用如下函数(归属baseR)来查看数据结构：

class(dataobject) 查看数据对象的类别

dim(dataobject) 查看数据的维度

names(dataobject) 查看列名

str(dataobject) 查看数据概要

glimpse(dataobject) 查看数据概要

二、将数据变得整洁

可使用下列函数（归属package: tidyr）整理数据：

1. gather(data, key, value, -col ) 将多个列收紧成关键列值,宽数据变成长数据。

2. spread(data, key, value) 将关键列值扩展成多个列，长数据变成宽数据。

3. separate(data, col, into, sep = "") 将一列分成多列。

4. unite(data, col, ..., sep = "") 将多列合成一列。

杂乱数据的特征和对应处理函数：

1.列名是值（value)而不是变量(variable) ---gather

2.变量同时存在行和列中 ---spread

3.多个变量位于同一列 ---seperate

4.单个观测值位于多张数据表中，多个类型单元位于同张数据表 ---seperate+unite

三、准备用于分析的数据

1.数据的类别如下，可调用class()查看数据的类别，也可使用as.numeric()、as.factor()等函数来转换类别。

character

numeric

integer

factor

logical

2.对日期和时间的处理

需装载的package：lubridate

调用的函数：ymd_hms(), ymd()等。 ymd_hms 对应：年月日_时分秒

例子：

> dmy("17 Sep 2015")
[1] "2015-09-17"

3.字符串的处理

需装载的package：library(stringr)

调用的函数：

str_pad(string, width, side = c("left", "right", "both"), pad = " ") 填充字符串

str_trim(string) 清除字符串首尾空格

str_detect(string, pattern) 检测字符串中是否存在某个pattern

str_replace(string, pattern, replacement) 替代字符串中匹配的pattern

na.omit(df) 移除有缺失值的行

complete.cases(df) 查看没有缺失值的行

下面两个字符处理函数在baseR中

toupper(string) 转换成大写

tolower(string) 转换成小写

4. 缺失值和特殊值（miss and special value）

在R中，缺失值一般用NA表示。特殊值有 Inf(无穷值）、NaN（not a number）。

查看数据中是否有NA：

is.na(data)

any(is.na(data))

查看数据中没有缺失值的行：complete.cases(data)

在数据中移除有缺失值的行：na.omit(data)

5.处理数据中的异常值和明显错误

常用summary() 和 hist() 函数来确认异常值（或极端值）

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试教材；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试题库；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想了解CDA院校合作，点击>>> “院校合作” 了解咨询CDA院校合作；

特征数据分析

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇图论在大数据分析中的作用！

下一篇CDA认证再升一档！与国家共同推进大数据人才培养标准教育事业！

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

京公网安备 11010802034615号经营许可证编号：京B2-20210330

联系电话：13321103290 (微信同号)

客服在线

立即咨询

客服在线

立即咨询

免密码登录

提交首次登录验证后自动注册

在R中整理数据

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

CDA持证人专访：贺译册谈产品经理的市场洞察力与数 ...

【CDA干货】多维度对比评估：分析逻辑与可视化效果 ...

从“单元格”到“字段”：CDA数据分析师视角下的表 ...

【CDA干货】漏斗拆解：核心逻辑、实操方法与业务优 ...

【CDA干货】SQL数值转日期函数全解析：主流数据库语 ...

数据分析必修课：CDA数据分析师视角下的表格结构数 ...

CDA持证人专访：杨旭谈数据产品经理的工作实践与核 ...

【CDA干货】Python变量定义与类实例化：核心原理、 ...

从“单元格”到“洞察”：CDA数据分析师视角下的表 ...

【CDA干货】联合索引与覆盖索引：本质区别、实战场 ...

【CDA干货】维度表与事实表：数据仓库建模的核心逻 ...

从“指标堆砌”到“体系落地”：CDA数据分析师视角 ...

【CDA干货】SQL计算列值趋势的全场景实现方法与实战 ...

【CDA干货】用户决策链路全解析：从认知到复购的增 ...

CDA 三级《敏捷数据挖掘》教材知识体系全面解读 ...

【CDA干货】付费玩家流失的核心原因与游戏行业长效 ...

CDA持证人专访：蒋少寒谈传统制造业与互联网行业数 ...

学完商业数据分析，开启 CDA 量化策略：从业务思维 ...

CDA持证人专访：赵森淼谈药企数据分析从业体验与转 ...

【CDA干货】卡方检验与T检验结果的标准化解读方法及 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载