京公网安备 11010802034615号
经营许可证编号:京B2-20210330
1 数据导入
数据常用格式.csv/.txt/.xls/.json/.xml。
R语言提供相应的函数和库实现对这些数据格式的导入。
现已导入.csv格式和以tab分隔的.txt格式为例
# 读.csv格式
data1<-read.csv(file='C:/abc.csv',header=TRUE,sep=',')
# 读以tab分隔的.txt格式
data2<-read.csv(file='C:/abc.txt',header=TRUE,sep='\t')
2 数据类型变换
数据类型变换包括数据类型测试和数据类型之间的变换。
数据类型测试采用is.xyz系列函数,该函数测试是否为某一种数据类型,返回值是逻辑类型,即TRUE和FALSE。
数据类型变换采用as.xyz系列函数,把某一种数据类型变换到另一种数据类型。
例如:
is.numeric(),is.character(),is.vector(),is.matrix(),is.data.frame()
as.numeric(),as.character(),as.vector(),as.matrix(),as.data.frame()
3 数据集变换
library(reshape)
data3<-melt(mydata,id=c("id","time"))4 数据排序
利用order函数对单一变量或者多个变量进行排序(升序或者降序),返回具有排序功能的索引位置。
# sort by var1
data4<-old[order(var1),]
# sort by var1 and var2 (descending)
data5<-old[order(var1,-var2),]
5 数据可视化
利用R语言做数据可视简单和高效。
R语言画直方图
set.seed(1234)
score<-rnorm(n=1000,m=80,sd=20)
hist(score)
在直方图上面添加密度曲线
hist(score,
freq=FALSE,
xlab="Score",
main="Distribution of score",
col="lightgreen",
xlim=c(0,150),
ylim=c(0,0.02))
curve(dnorm(x,
mean=mean(score),
sd=sd(score)),
add=TRUE,
col="darkblue",
lwd=2)
6 列联表
列联表是理解各类分布的最基本和最有效的方式。
单变量列联表
多变量列联表
参考代码
library(gmodels)
CrossTable(mydata$myrowvar,mydata$mycolvar)
7 数据抽样
利用sample函数实现数据抽样
从数据集中不放回地随机抽取100个样本
参考代码:
mysample<-mydata[sample(1:nrow(mydata),100,replace=FALSE),]
8 数据去重
利用unique函数去掉向量中的重复值
set.seed(1234)
x<-round(rnorm(20,10,5))
x
unique(x)
结果如下
9 数据汇总
使用apply系列函数,实现汇总
10 缺失值识别和处理
使用is.na函数识别缺失值,采用均值、中位数、众数、插补法等方法对确实值处理。
y<-c(4,5,6,NA)
is.na(y)
y[is.na(y)]<-mean(y,na.rm=TRUE)
y
11 异常值识别和处理
异常值识别-异常值定位-异常值处理
异常值识别方法:盒箱图和简单统计量
异常值处理方法:剔除法/修复法
12 数据合并
利用merge函数或者rbind函数或者sqldf包基于数据库的连接操作
# merge two data frames by ID
total<-merge(data frameA,data frameB,by="ID"
# merge two data frames by ID and Country
total<-merge(data frameA,data frameB,by=c("ID","Country"))
total<-rbind(data frameA,data frameB)
总结
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在休闲游戏的运营体系中,次日留存率是当之无愧的“生死线”——它不仅是衡量产品核心吸引力的首个关键指标,更直接决定了后续LT ...
2025-12-16在数字化转型浪潮中,“以用户为中心”已成为企业的核心经营理念,而用户画像则是企业洞察用户、精准决策的“核心工具”。然而, ...
2025-12-16在零售行业从“流量争夺”转向“价值深耕”的演进中,塔吉特百货(Target)以两场标志性实践树立了行业标杆——2000年后的孕妇精 ...
2025-12-15在统计学领域,二项分布与卡方检验是两个高频出现的概念,二者都常用于处理离散数据,因此常被初学者混淆。但本质上,二项分布是 ...
2025-12-15在CDA(Certified Data Analyst)数据分析师的工作链路中,“标签加工”是连接原始数据与业务应用的关键环节。企业积累的用户行 ...
2025-12-15在Python开发中,HTTP请求是与外部服务交互的核心场景——调用第三方API、对接微服务、爬取数据等都离不开它。虽然requests库已 ...
2025-12-12在数据驱动决策中,“数据波动大不大”是高频问题——零售店长关心日销售额是否稳定,工厂管理者关注产品尺寸偏差是否可控,基金 ...
2025-12-12在CDA(Certified Data Analyst)数据分析师的能力矩阵中,数据查询语言(SQL)是贯穿工作全流程的“核心工具”。无论是从数据库 ...
2025-12-12很多小伙伴都在问CDA考试的问题,以下是结合 2025 年最新政策与行业动态更新的 CDA 数据分析师认证考试 Q&A,覆盖考试内容、报考 ...
2025-12-11在Excel数据可视化中,柱形图因直观展示数据差异的优势被广泛使用,而背景色设置绝非简单的“换颜色”——合理的背景色能突出核 ...
2025-12-11在科研实验、商业分析或医学研究中,我们常需要判断“两组数据的差异是真实存在,还是偶然波动”——比如“新降压药的效果是否优 ...
2025-12-11在CDA(Certified Data Analyst)数据分析师的工作体系中,数据库就像“数据仓库的核心骨架”——所有业务数据的存储、组织与提 ...
2025-12-11在神经网络模型搭建中,“最后一层是否添加激活函数”是新手常困惑的关键问题——有人照搬中间层的ReLU激活,导致回归任务输出异 ...
2025-12-05在机器学习落地过程中,“模型准确率高但不可解释”“面对数据噪声就失效”是两大核心痛点——金融风控模型若无法解释决策依据, ...
2025-12-05在CDA(Certified Data Analyst)数据分析师的能力模型中,“指标计算”是基础技能,而“指标体系搭建”则是区分新手与资深分析 ...
2025-12-05在回归分析的结果解读中,R方(决定系数)是衡量模型拟合效果的核心指标——它代表因变量的变异中能被自变量解释的比例,取值通 ...
2025-12-04在城市规划、物流配送、文旅分析等场景中,经纬度热力图是解读空间数据的核心工具——它能将零散的GPS坐标(如外卖订单地址、景 ...
2025-12-04在CDA(Certified Data Analyst)数据分析师的指标体系中,“通用指标”与“场景指标”并非相互割裂的两个部分,而是支撑业务分 ...
2025-12-04每到“双十一”,电商平台的销售额会迎来爆发式增长;每逢冬季,北方的天然气消耗量会显著上升;每月的10号左右,工资发放会带动 ...
2025-12-03随着数字化转型的深入,企业面临的数据量呈指数级增长——电商的用户行为日志、物联网的传感器数据、社交平台的图文视频等,这些 ...
2025-12-03