京公网安备 11010802034615号
经营许可证编号:京B2-20210330
R语言:排序问题
数据排序
1、sort(),rank(),order()函数
Sort
排序(默认升序,decreasing=T时为降序)
Order
排序(默认升序,decreasing=T时为降序)
在R中,和排序相关的函数主要有三个:sort(),rank(),order()。
sort(x)是对向量x进行排序,返回值排序后的数值向量。rank()是求秩的函数,它的返回值是这个向量中对应元素的“排名”。而order()的返回值是对应“排名”的元素所在向量中的位置。
下面以一小段R代码来举例说明:
[plain] view plain copy
print?在CODE上查看代码片派生到我的代码片
x<-c(97,93,85,74,32,100,99,67)
sort(x)
[1] 32 67 74 85 93 97 99 100
order(x) #order()的返回值是各个排名的学生成绩所在向量中的位置
[1] 5 8 4 3 2 1 7 6
rank(x) #rank()的返回值是这组学生所对应的排名
[1] 6 5 4 3 1 8 7 2
深入理解一下:
sort()在单变量排序中,效果较好;
order()≈原序号(sort()) 因为可以标记排序好之后的下标,在数据框中的排序操作,实用性超强,可以实现:
1、整个数据集按照某个变量(比如:按月份大小)排序;
2、整个数据集其中某个变量依据第二个变量(比如:月份)排序。
[plain] view plain copy
print?在CODE上查看代码片派生到我的代码片
iris;iris[1:10,]
names(iris)
#单数据列,两者相同
sort(iris$Sepal.Length)
iris$Sepal.Length[order(iris$Sepal.Length)]
#多数据列,order有奇效
iris[order(iris$setosa),] #按照setosa的大小,重排整个数据集
iris$Sepal.Length[order(iris$setosa)] #按照照setosa的大小,重排Sepal.Length数据列
iris[order(iris$setosa),]$Sepal.Length #与上句异曲同工
与which有一些地方的相似,which可以实现返回服从条件观测的行数。which又与subset子集筛选有关。(详见which、subset子集筛选用法)
[plain] view plain copy
print?在CODE上查看代码片派生到我的代码片
data$V1[which(data$V2<0)] #筛选出V1中,V2小于0的数字,跟order的作用些许相似
#order用法
iris$Sepal.Length[order(iris$setosa)] #按照照setosa的大小,重排Sepal.Length数据列
2、dplyr包的一些应用
[plain] view plain copy
print?在CODE上查看代码片派生到我的代码片
#dplyr中基本函数 arrange——数据排序
Hdma_dat[order(Hdma_dat$survived),] #传统方法用order排序
arrange(Hdma_dat,survived) #将survived从小到大排序
arrange(Hdma_dat,desc(survived) #将survived从大到小排序
arrange(Hdma_dat,pclass,desc(survived) #先将pclass从小到大排序,再在那个数据基础上让survived从大到小排序
使用场景(我经常搞错...):
譬如我想知道一组数:b = c(0.9984616870 ,1.0177739597 ,0.0004250664 ,0.0015771710, 1.0177739597)
场景一:最大值的位置信息,我想拿到的数据是每个数值对应的大小次序,升序,理应(3 4.5 1 2 4.5)
那么:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
rank(b)
order(b)
如果降序,就不一样了:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
> order(c(0.9984616870 ,1.0177739597 ,0.0004250664 ,0.0015771710, 1.0177739597) ,decreasing = T)
[1] 2 5 1 4 3
order=rank+sort功能=次序信息(rank)+次序排序(sort)
接下来的两个用法是我很容易搞错的:
我想拿到 降序 + 不排序的次序信息,rank不适合;
降序 + 排序的次序信息,order适合
若:
(1)按照某行顺序从大到小重排另一行:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
data$x1[order(data$x2)]
(2)按照某行最大值对位的另一行:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
data$x1[order(data$x2)[1] ]
第二种办法:
[html] view plain copy
print?在CODE上查看代码片派生到我的代码片
data$x1[rank(data$x2) == max值]
注意区别。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、机器学习的实操场景中,聚类分析与主成分分析(PCA)是两种高频使用的统计与数据处理方法。二者常被用于数据预处理 ...
2026-02-24在聚类分析的实操场景中,K-Means算法因其简单高效、易落地的特点,成为处理无监督分类问题的首选工具——无论是用户画像分层、 ...
2026-02-24数字化浪潮下,数据已成为企业核心竞争力,“用数据说话、用数据决策”成为企业发展的核心逻辑。CDA(Certified Data Analyst) ...
2026-02-24CDA一级知识点汇总手册 第五章 业务数据的特征、处理与透视分析考点52:业务数据分析基础考点53:输入和资源需求考点54:业务数 ...
2026-02-23CDA一级知识点汇总手册 第四章 战略与业务数据分析考点43:战略数据分析基础考点44:表格结构数据的使用考点45:输入数据和资源 ...
2026-02-22CDA一级知识点汇总手册 第三章 商业数据分析框架考点27:商业数据分析体系的核心逻辑——BSC五视角框架考点28:战略视角考点29: ...
2026-02-20CDA一级知识点汇总手册 第二章 数据分析方法考点7:基础范式的核心逻辑(本体论与流程化)考点8:分类分析(本体论核心应用)考 ...
2026-02-18第一章:数据分析思维考点1:UVCA时代的特点考点2:数据分析背后的逻辑思维方法论考点3:流程化企业的数据分析需求考点4:企业数 ...
2026-02-16在数据分析、业务决策、科学研究等领域,统计模型是连接原始数据与业务价值的核心工具——它通过对数据的规律提炼、变量关联分析 ...
2026-02-14在SQL查询实操中,SELECT * 与 SELECT 字段1, 字段2,...(指定个别字段)是最常用的两种查询方式。很多开发者在日常开发中,为了 ...
2026-02-14对CDA(Certified Data Analyst)数据分析师而言,数据分析的核心不是孤立解读单个指标数值,而是构建一套科学、完整、贴合业务 ...
2026-02-14在Power BI实操中,函数是实现数据清洗、建模计算、可视化呈现的核心工具——无论是简单的数据筛选、异常值处理,还是复杂的度量 ...
2026-02-13在互联网运营、产品迭代、用户增长等工作中,“留存率”是衡量产品核心价值、用户粘性的核心指标——而次日留存率,作为留存率体 ...
2026-02-13对CDA(Certified Data Analyst)数据分析师而言,指标是贯穿工作全流程的核心载体,更是连接原始数据与业务洞察的关键桥梁。CDA ...
2026-02-13在机器学习建模实操中,“特征选择”是提升模型性能、简化模型复杂度、解读数据逻辑的核心步骤——而随机森林(Random Forest) ...
2026-02-12在MySQL数据查询实操中,按日期分组统计是高频需求——比如统计每日用户登录量、每日订单量、每日销售额,需要按日期分组展示, ...
2026-02-12对CDA(Certified Data Analyst)数据分析师而言,描述性统计是贯穿实操全流程的核心基础,更是从“原始数据”到“初步洞察”的 ...
2026-02-12备考CDA的小伙伴,专属宠粉福利来啦! 不用拼运气抽奖,不用复杂操作,只要转发CDA真题海报到朋友圈集赞,就能免费抱走实用好礼 ...
2026-02-11在数据科学、机器学习实操中,Anaconda是必备工具——它集成了Python解释器、conda包管理器,能快速搭建独立的虚拟环境,便捷安 ...
2026-02-11在Tableau数据可视化实操中,多表连接是高频操作——无论是将“产品表”与“销量表”连接分析产品销量,还是将“用户表”与“消 ...
2026-02-11