pandas 的主要数据结构

Series 对象

一种类似一维数组的对象

由一组数据以及一组与之相关的数据标签(即索引)组成

可以存储任何类型的数据

创建 Series 对象

Pandas使用Series()函数来创建Series对象,通过这个对象可以调用相应的方法和属性,从而达到处理数据的目的。

访问 Series 对象

Series 的常用属性

Series 的常用方法

DataFrame 对象

https://pandas.pydata.org/docs/reference/api/pandas.DataFrame.html#pandas.DataFrame

一种表格型数据结构(行标签 index,列标签 columns)

异构数据表:表格中每列的数据类型可以不同

创建 DataFrame 对象

pd.DateFrame(data, index, columns, dtype)

由 Series 演变而来,每一行或列数据都可以看成一个 Series 结构

创建 DataFrame 对象

pd.DataFrame(data, index, columns, dtype)

用列表创建

用字典嵌套列表创建

键对应的元素长度必须相同

DataFrame 的常用属性

DataFrame 重要函数

pandas 导入外部数据

https://pandas.pydata.org/docs/reference/io.html

pandas可以对多种类型的数据进行读写操作,包括:Excel、CSV、HTML、JSON、Latex、SQL、SPSS、SAS、STATA、ORC、Feather、Parquet等文件类型

pd.read_X()

pd.DataFrame.to_X()

导入 Excel 数据

.xls``.xlsx文件

pd.read_excel(io, sheet_name, header, index_col, usecols)

导入 CSV 数据

Comma-Separated Values

pd.read_csv(io, sep=',', encoding, index_col, usecols)

导出数据

pd.DataFrame.to_excel()

pd.DataFrame.to_csv()

pd.DataFrame.to_excel(excel_writer, sheet_name, index)

pandas 数据清洗

https://data.stats.gov.cn/easyquery.htm?cn=C01

发现 2022 -2025 并没有更新,所以用到的数据是 2021 年及之前 20 年的数据。

原始数据分析

表头、空值、表尾等,要根据实际情况处理调整原始数据

整体思路:

提取有效数据,去头、去尾

使用 apply() 方法对每个指标名称进行处理

dropna 删除空值 & fillna 填充空值

df.dropna(axis, how, thresh, inplace)

pandas 数据可视化

plot(data, x, y, kind, legend, ...)

https://pandas.pydata.org/docs/reference/api/pandas.DataFrame.plot.bar.html#pandas.DataFrame.plot.bar

绘制柱状图

数据的分类与排序

由于分类太多,且部分数据很小很小,所以可以将其归入其他疾病,图中只展示 Top10

完整代码