热线电话：13121318867

介绍一款进阶版的Pandas数据分析神器：Polars

2022-04-11

作者：俊欣

来源：关于数据分析与可视化

相信对于不少的数据分析从业者来说呢，用的比较多的是Pandas以及SQL这两种工具，Pandas不但能够对数据集进行清理与分析，并且还能够绘制各种各样的炫酷的图表，但是遇到数据集很大的时候要是还使用Pandas来处理显然有点力不从心。

今天小编就来介绍另外一个数据处理与分析工具，叫做Polars，它在数据处理的速度上更快，当然里面还包括两种API，一种是Eager API，另一种则是Lazy API，其中Eager API和Pandas的使用类似，语法类似差不太多，立即执行就能产生结果。

而Lazy API和Spark很相似，会有并行以及对查询逻辑优化的操作。

模块的安装与导入

我们先来进行模块的安装，使用pip命令

pip install polars

在安装成功之后，我们分别用Pandas和Polars来读取数据，看一下各自性能上的差异，我们导入会要用到的模块

import pandas as pd import polars as pl import matplotlib.pyplot as plt
%matplotlib inline

用Pandas读取文件

本次使用的数据集是某网站注册用户的用户名数据，总共有360MB大小，我们先用Pandas模块来读取该csv文件

%%time df = pd.read_csv("users.csv")
df.head()

output

可以看到用Pandas读取CSV文件总共花费了12秒的时间，数据集总共有两列，一列是用户名称，以及用户名称重复的次数“n”，我们来对数据集进行排序，调用的是sort_values()方法，代码如下

%%time df.sort_values("n", ascending=False).head()

output

用Polars来读取操作文件

下面我们用Polars模块来读取并操作文件，看看所需要的多久的时间，代码如下

%%time data = pl.read_csv("users.csv") data.head()

output

可以看到用polars模块来读取数据仅仅只花费了730毫秒的时间，可以说是快了不少的，我们根据“n”这一列来对数据集进行排序，代码如下

%%time data.sort(by="n", reverse=True).head()

output

对数据集进行排序所消耗的时间为1.39秒，接下来我们用polars模块来对数据集进行一个初步的探索性分析，数据集总共有哪些列、列名都有哪些，我们还是以熟知“泰坦尼克号”数据集为例

df_titanic = pd.read_csv("titanic.csv")
df_titanic.columns

output

['PassengerId',
 'Survived',
 'Pclass',
 'Name',
 'Sex',
 'Age',
 ......]

和Pandas一样输出列名调用的是columns方法，然后我们来看一下数据集总共是有几行几列的，

df_titanic.shape

output

(891, 12)

看一下数据集中每一列的数据类型

df_titanic.dtypes

output

[polars.datatypes.Int64,
 polars.datatypes.Int64,
 polars.datatypes.Int64,
 polars.datatypes.Utf8,
 polars.datatypes.Utf8,
 polars.datatypes.Float64,
......]

填充空值与数据的统计分析

我们来看一下数据集当中空值的分布情况，调用null_count()方法

df_titanic.null_count()

output

我们可以看到“Age”以及“Cabin”两列存在着空值，我们可以尝试用平均值来进行填充，代码如下

df_titanic["Age"] = df_titanic["Age"].fill_nan(df_titanic["Age"].mean())

计算某一列的平均值只需要调用mean()方法即可，那么中位数、最大/最小值的计算也是同样的道理，代码如下

print(f'Median Age: {df_titanic["Age"].median()}')
print(f'Average Age: {df_titanic["Age"].mean()}')
print(f'Maximum Age: {df_titanic["Age"].max()}')
print(f'Minimum Age: {df_titanic["Age"].min()}')

output

Median Age: 29.69911764705882 Average Age: 29.699117647058817 Maximum Age: 80.0 Minimum Age: 0.42

数据的筛选与可视化

我们筛选出年龄大于40岁的乘客有哪些，代码如下

df_titanic[df_titanic["Age"] > 40]

output

最后我们简单地来绘制一张图表，代码如下

fig, ax = plt.subplots(figsize=(10, 5))
ax.boxplot(df_titanic["Age"])
plt.xticks(rotation=90)
plt.xlabel('Age Column')
plt.ylabel('Age')
plt.show()

output

总体来说呢，polars在数据分析与处理上面和Pandas模块有很多相似的地方，其中会有一部分的API存在着差异。

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试教材；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试题库；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想了解CDA院校合作，点击>>> “院校合作” 了解咨询CDA院校合作；

数据分析数据处理 matplotlib SQL python pandas 数据类型统计分析

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇你们都有switch，凭什么我python没有？

下一篇JavaScript 逆向爬虫中的浏览器调试常见技巧

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

京公网安备 11010802034615号经营许可证编号：京B2-20210330

联系电话：13321103290 (微信同号)

客服在线

立即咨询

客服在线

立即咨询

免密码登录

提交首次登录验证后自动注册

介绍一款进阶版的Pandas数据分析神器：Polars

模块的安装与导入

用Pandas读取文件

用Polars来读取操作文件

填充空值与数据的统计分析

数据的筛选与可视化

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

【CDA干货】神经网络最后一层：激活函数加还是不加 ...

【CDA干货】特征相对重要性：解锁模型鲁棒性与可解 ...

CDA数据分析师：指标体系搭建方法论，让数据驱动精 ...

【CDA干货】回归分析中调整后R方为负？本质、成因与 ...

【CDA干货】经纬度热力图：从离散坐标到空间密度的 ...

CDA数据分析师：用通用与场景指标，构建业务洞察双 ...

【CDA干货】季节分解法：解锁时间序列数据的“四季 ...

【CDA干货】大数据存储技术全景解析：从架构到选型 ...

CDA数据分析师：以指标为钥，解锁数据与业务的连接 ...

【CDA干货】神经网络损失函数：没有“最佳值”，但 ...

CDA数据分析师：用参数估计，让样本数据说出总体真 ...

【CDA干货】数据标准化后出现负值？别急！场景化解 ...

【CDA干货】数据驱动增长：三大行业A/B测试落地案例 ...

【CDA干货】解密LSTM预测结果：为何有时相同，有时 ...

描述性统计：CDA数据分析师的“数据透视镜” ...

【CDA干货】从杂乱到清晰：无序数据点的系统分析方 ...

【CDA干货】MySQL查询阻塞在query end状态：排查与 ...

CDA数据分析师：用透视分析方法，让表结构数据秒变 ...

【CDA干货】分布的“性格”：正态与偏态如何左右统 ...

【CDA干货】一次查500条vs5次查100条：数据查询的压 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载