
数据重塑,顾名思义就是给数据做各种变形,主要有以下几种:
根据索引(index)、列(column)(values)值), 对原有DataFrame(数据框)进行变形重塑,俗称长表转宽表
import pandas as pd
import numpy as np
df = pd.DataFrame(
{ '姓名': ['张三', '张三', '张三', '李四', '李四', '李四'],
'科目': ['语文', '数学', '英语', '语文', '数学', '英语'],
'成绩': [91, 80, 100, 80, 100, 96]})
df
姓名 | 科目 | 成绩 | |
---|---|---|---|
0 | 张三 | 语文 | 91 |
1 | 张三 | 数学 | 80 |
2 | 张三 | 英语 | 100 |
3 | 李四 | 语文 | 80 |
4 | 李四 | 数学 | 100 |
5 | 李四 | 英语 | 96 |
长转宽:使用 df.pivot
以姓名
为index
,以各科目
为columns
,来统计各科成绩:
df = pd.DataFrame(
{ '姓名': ['张三', '张三', '张三', '李四', '李四', '李四'],
'科目': ['语文', '数学', '英语', '语文', '数学', '英语'],
'成绩': [91, 80, 100, 80, 100, 96]})
df
姓名 | 科目 | 成绩 | |
---|---|---|---|
0 | 张三 | 语文 | 91 |
1 | 张三 | 数学 | 80 |
2 | 张三 | 英语 | 100 |
3 | 李四 | 语文 | 80 |
4 | 李四 | 数学 | 100 |
5 | 李四 | 英语 | 96 |
df.pivot(index='姓名', columns='科目', values='成绩')
科目 | 数学 | 英语 | 语文 |
---|---|---|---|
姓名 | |||
张三 | 80 | 100 | 91 |
李四 | 100 | 96 | 80 |
df = pd.DataFrame(
{ '姓名': ['张三', '张三', '张三', '李四', '李四', '李四'],
'科目': ['语文', '数学', '英语', '语文', '数学', '英语'],
'成绩': [91, 80, 100, 80, 100, 96]})
df1 = pd.pivot(df, index='姓名', columns='科目', values='成绩').reset_index()
df1
科目 | 姓名 | 数学 | 英语 | 语文 |
---|---|---|---|---|
0 | 张三 | 80 | 100 | 91 |
1 | 李四 | 100 | 96 | 80 |
宽表变长表:使用 pd.melt
以姓名
为标识变量的列id_vars
,以各科目
为value_vars
,来统计各科成绩:
df1.melt(id_vars=['姓名'], value_vars=['数学', '英语', '语文'])
姓名 | 科目 | value | |
---|---|---|---|
0 | 张三 | 数学 | 80 |
1 | 李四 | 数学 | 100 |
2 | 张三 | 英语 | 100 |
3 | 李四 | 英语 | 96 |
4 | 张三 | 语文 | 91 |
5 | 李四 | 语文 | 80 |
random.seed(1024)
df = pd.DataFrame(
{'专业': np.repeat(['数学与应用数学', '计算机', '统计学'], 4),
'班级': ['1班','1班','2班','2班']*3,
'科目': ['高数', '线代'] * 6,
'平均分': [random.randint(60,100) for i in range(12)],
'及格人数': [random.randint(30,50) for i in range(12)]})
df
专业 | 班级 | 科目 | 平均分 | 及格人数 | |
---|---|---|---|---|---|
0 | 数学与应用数学 | 1班 | 高数 | 61 | 34 |
1 | 数学与应用数学 | 1班 | 线代 | 90 | 42 |
2 | 数学与应用数学 | 2班 | 高数 | 84 | 33 |
3 | 数学与应用数学 | 2班 | 线代 | 80 | 43 |
4 | 计算机 | 1班 | 高数 | 93 | 34 |
5 | 计算机 | 1班 | 线代 | 66 | 43 |
6 | 计算机 | 2班 | 高数 | 88 | 45 |
7 | 计算机 | 2班 | 线代 | 92 | 44 |
8 | 统计学 | 1班 | 高数 | 83 | 46 |
9 | 统计学 | 1班 | 线代 | 83 | 41 |
10 | 统计学 | 2班 | 高数 | 84 | 49 |
11 | 统计学 | 2班 | 线代 | 66 | 49 |
各个专业对应科目的及格人数和平均分
pd.pivot_table(df, index=['专业','科目'],
values=['及格人数','平均分'],
aggfunc={'及格人数':np.sum,"平均分":np.mean})
及格人数 | 平均分 | ||
---|---|---|---|
专业 | 科目 | ||
数学与应用数学 | 线代 | 85 | 85.0 |
高数 | 67 | 72.5 | |
统计学 | 线代 | 90 | 74.5 |
高数 | 95 | 83.5 | |
计算机 | 线代 | 87 | 79.0 |
高数 | 79 | 90.5 |
补充说明:
df.pivot_table()
和df.pivot()
都是Pandas中用于将长表转换为宽表的方法,但它们在使用方式和功能上有一些区别。
使用方式:
处理重复值:
聚合操作:
总的来说,df.pivot()
方法适用于长表中不存在重复值的情况,而df.pivot_table()
方法适用于长表中存在重复值的情况,并且可以对重复值进行聚合操作。根据具体的数据结构和分析需求,选择合适的方法来进行转换操作。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
评判两组数据与初始数据准确值的方法 在数据分析与研究中,我们常常会面临这样的情况:需要对通过不同方法、不同过程得到的两组 ...
2025-08-01通过 COX 回归模型诊断异常值 一、COX 回归模型概述 COX 回归模型,又称比例风险回归模型,是一种用于生存分析的统计方法。它能 ...
2025-08-01CDA 数据分析师报考条件详解:迈向专业认证的指南 在数据分析行业蓬勃发展的当下,CDA 数据分析师认证成为众多从业者提升专业 ...
2025-08-01K-S 曲线、回归与分类:数据分析中的重要工具 在数据分析与机器学习领域,K-S 曲线、回归和分类是三个核心概念与工具,它们各 ...
2025-07-31大数据时代对定性分析的影响 在大数据时代,海量、多样、高速且低价值密度的数据充斥着我们的生活与工作。而定性分析作为一 ...
2025-07-31CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-07-31SASEM 决策树:理论与实践应用 在复杂的决策场景中,如何从海量数据中提取有效信息并制定科学决策,是各界关注的焦点。SASEM 决 ...
2025-07-30SPSS 语法使用详解 在当今数据驱动的时代,SPSS( Statistical Package for the Social Sciences)作为一款功能强大的统计分析软 ...
2025-07-30人工智能对CDA数据分析领域的影响 人工智能对 CDA(Certified Data Analyst,注册数据分析师)数据分析领域的影响是全方位、多层 ...
2025-07-30MySQL执行计划中rows的计算逻辑:从原理到实践 MySQL 执行计划中 rows 的计算逻辑:从原理到实践 在 MySQL 数据库的查询优化中 ...
2025-07-29左偏态分布转正态分布:方法、原理与实践 左偏态分布转正态分布:方法、原理与实践 在统计分析、数据建模和科学研究中,正态分 ...
2025-07-29CDA 数据分析师的职业生涯规划:从入门到卓越的成长之路 在数字经济蓬勃发展的当下,数据已成为企业核心竞争力的重要来源,而 CD ...
2025-07-29CDA数据分析师证书考取全攻略 一、了解 CDA 数据分析师认证 CDA 数据分析师认证是一套科学化、专业化、国际化的人才考核标准, ...
2025-07-29解析神经网络中 Softmax 函数的核心作用 在神经网络的发展历程中,激活函数扮演着至关重要的角色,它们为网络赋予了非线性能力, ...
2025-07-29解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-07-29鸢尾花判别分析:机器学习中的经典实践案例 在机器学习的世界里,有一个经典的数据集如同引路明灯,为无数初学者打开了模式识别 ...
2025-07-29用 Python 开启数据分析之旅:从基础到实践的完整指南 在数据驱动决策的时代,数据分析已成为各行业不可或缺的核心能力。而 Pyt ...
2025-07-29从 CDA LEVEL II 考试题型看 Python 数据分析要点 在数据科学领域蓬勃发展的当下,CDA(Certified Data Analyst)认证成为众多从 ...
2025-07-29CDA 数据分析师的工作范围解析 在数字化时代的浪潮下,数据已成为企业发展的核心资产之一。CDA(Certified Data Analyst)数据分 ...
2025-07-29解析 insert into select 是否会锁表:原理、场景与应对策略 在数据库操作中,insert into select 是一种常用的批量数据插入语句 ...
2025-07-29