京公网安备 11010802034615号
经营许可证编号:京B2-20210330
R语言:排序问题
数据排序
1、sort(),rank(),order()函数
Sort
排序(默认升序,decreasing=T时为降序)
Order
排序(默认升序,decreasing=T时为降序)
在R中,和排序相关的函数主要有三个:sort(),rank(),order()。
sort(x)是对向量x进行排序,返回值排序后的数值向量。rank()是求秩的函数,它的返回值是这个向量中对应元素的“排名”。而order()的返回值是对应“排名”的元素所在向量中的位置。
下面以一小段R代码来举例说明:
[plain] view plain copy
print?在CODE上查看代码片派生到我的代码片
x<-c(97,93,85,74,32,100,99,67)
sort(x)
[1] 32 67 74 85 93 97 99 100
order(x) #order()的返回值是各个排名的学生成绩所在向量中的位置
[1] 5 8 4 3 2 1 7 6
rank(x) #rank()的返回值是这组学生所对应的排名
[1] 6 5 4 3 1 8 7 2
深入理解一下:
sort()在单变量排序中,效果较好;
order()≈原序号(sort()) 因为可以标记排序好之后的下标,在数据框中的排序操作,实用性超强,可以实现:
1、整个数据集按照某个变量(比如:按月份大小)排序;
2、整个数据集其中某个变量依据第二个变量(比如:月份)排序。
[plain] view plain copy
print?在CODE上查看代码片派生到我的代码片
iris;iris[1:10,]
names(iris)
#单数据列,两者相同
sort(iris$Sepal.Length)
iris$Sepal.Length[order(iris$Sepal.Length)]
#多数据列,order有奇效
iris[order(iris$setosa),] #按照setosa的大小,重排整个数据集
iris$Sepal.Length[order(iris$setosa)] #按照照setosa的大小,重排Sepal.Length数据列
iris[order(iris$setosa),]$Sepal.Length #与上句异曲同工
与which有一些地方的相似,which可以实现返回服从条件观测的行数。which又与subset子集筛选有关。(详见which、subset子集筛选用法)
[plain] view plain copy
print?在CODE上查看代码片派生到我的代码片
data$V1[which(data$V2<0)] #筛选出V1中,V2小于0的数字,跟order的作用些许相似
#order用法
iris$Sepal.Length[order(iris$setosa)] #按照照setosa的大小,重排Sepal.Length数据列
2、dplyr包的一些应用
[plain] view plain copy
print?在CODE上查看代码片派生到我的代码片
#dplyr中基本函数 arrange——数据排序
Hdma_dat[order(Hdma_dat$survived),] #传统方法用order排序
arrange(Hdma_dat,survived) #将survived从小到大排序
arrange(Hdma_dat,desc(survived) #将survived从大到小排序
arrange(Hdma_dat,pclass,desc(survived) #先将pclass从小到大排序,再在那个数据基础上让survived从大到小排序
使用场景(我经常搞错...):
譬如我想知道一组数:b = c(0.9984616870 ,1.0177739597 ,0.0004250664 ,0.0015771710, 1.0177739597)
场景一:最大值的位置信息,我想拿到的数据是每个数值对应的大小次序,升序,理应(3 4.5 1 2 4.5)
那么:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
rank(b)
order(b)
如果降序,就不一样了:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
> order(c(0.9984616870 ,1.0177739597 ,0.0004250664 ,0.0015771710, 1.0177739597) ,decreasing = T)
[1] 2 5 1 4 3
order=rank+sort功能=次序信息(rank)+次序排序(sort)
接下来的两个用法是我很容易搞错的:
我想拿到 降序 + 不排序的次序信息,rank不适合;
降序 + 排序的次序信息,order适合
若:
(1)按照某行顺序从大到小重排另一行:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
data$x1[order(data$x2)]
(2)按照某行最大值对位的另一行:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
data$x1[order(data$x2)[1] ]
第二种办法:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
data$x1[rank(data$x2) == max值]
注意区别。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在使用Excel数据透视表进行数据分析时,我们常需要在透视表旁添加备注列,用于标注数据背景、异常说明、业务解读等关键信息。但 ...
2025-12-22在MySQL数据库的性能优化体系中,索引是提升查询效率的“核心武器”——一个合理的索引能将百万级数据的查询耗时从秒级压缩至毫 ...
2025-12-22在数据量爆炸式增长的数字化时代,企业数据呈现“来源杂、格式多、价值不均”的特点,不少CDA(Certified Data Analyst)数据分 ...
2025-12-22在企业数据化运营体系中,同比、环比分析是洞察业务趋势、评估运营效果的核心手段。同比(与上年同期对比)可消除季节性波动影响 ...
2025-12-19在数字化时代,用户已成为企业竞争的核心资产,而“理解用户”则是激活这一资产的关键。用户行为分析系统(User Behavior Analys ...
2025-12-19在数字化转型的深水区,企业对数据价值的挖掘不再局限于零散的分析项目,而是转向“体系化运营”——数据治理体系作为保障数据全 ...
2025-12-19在数据科学的工具箱中,析因分析(Factor Analysis, FA)、聚类分析(Clustering Analysis)与主成分分析(Principal Component ...
2025-12-18自2017年《Attention Is All You Need》一文问世以来,Transformer模型凭借自注意力机制的强大建模能力,在NLP、CV、语音等领域 ...
2025-12-18在CDA(Certified Data Analyst)数据分析师的时间序列分析工作中,常面临这样的困惑:某电商平台月度销售额增长20%,但增长是来 ...
2025-12-18在机器学习实践中,“超小数据集”(通常指样本量从几十到几百,远小于模型参数规模)是绕不开的场景——医疗领域的罕见病数据、 ...
2025-12-17数据仓库作为企业决策分析的“数据中枢”,其价值完全依赖于数据质量——若输入的是缺失、重复、不一致的“脏数据”,后续的建模 ...
2025-12-17在CDA(Certified Data Analyst)数据分析师的日常工作中,“随时间变化的数据”无处不在——零售企业的每日销售额、互联网平台 ...
2025-12-17在休闲游戏的运营体系中,次日留存率是当之无愧的“生死线”——它不仅是衡量产品核心吸引力的首个关键指标,更直接决定了后续LT ...
2025-12-16在数字化转型浪潮中,“以用户为中心”已成为企业的核心经营理念,而用户画像则是企业洞察用户、精准决策的“核心工具”。然而, ...
2025-12-16在零售行业从“流量争夺”转向“价值深耕”的演进中,塔吉特百货(Target)以两场标志性实践树立了行业标杆——2000年后的孕妇精 ...
2025-12-15在统计学领域,二项分布与卡方检验是两个高频出现的概念,二者都常用于处理离散数据,因此常被初学者混淆。但本质上,二项分布是 ...
2025-12-15在CDA(Certified Data Analyst)数据分析师的工作链路中,“标签加工”是连接原始数据与业务应用的关键环节。企业积累的用户行 ...
2025-12-15在Python开发中,HTTP请求是与外部服务交互的核心场景——调用第三方API、对接微服务、爬取数据等都离不开它。虽然requests库已 ...
2025-12-12在数据驱动决策中,“数据波动大不大”是高频问题——零售店长关心日销售额是否稳定,工厂管理者关注产品尺寸偏差是否可控,基金 ...
2025-12-12在CDA(Certified Data Analyst)数据分析师的能力矩阵中,数据查询语言(SQL)是贯穿工作全流程的“核心工具”。无论是从数据库 ...
2025-12-12