百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

用 Pandera 高效验证和清洗 Pandas 数据集——实用分步指南

off999 2025-06-10 17:28 32 浏览 0 评论

当我们处理数据时,确保数据不脏、不无效非常重要——比如检查空值、缺失值,或某列类型不允许的数字。这些检查至关重要,因为劣质数据会导致错误分析、模型失败,并浪费大量时间和资源。

你可能已经用传统的 Pandas 方法清理和验证过数据,但在本教程中,我想向你介绍一款更强大的 Python 库:Pandera。Pandera 提供了灵活且表达力强的 API,可对类 DataFrame 对象进行数据验证。与手动检查相比,它更快、更具扩展性。你只需创建定义数据结构、数据类型和规则的 schema(模式),然后 Pandera 会根据这些 schema 检查你的数据,指出不符合要求的地方,让你能在早期发现并修正问题,避免日后遇到大麻烦。

本指南假设你已经具备一定的 Python 和 Pandas 基础。让我们一步步学习如何在工作流中使用 Pandera。


第 1 步:环境配置

首先,需要安装必要的包:

pip install pandera pandas

安装完成后,导入所需库,并验证安装结果:

import pandas as pd
import pandera as pa

print("pandas version:", pd.__version__)
print("pandera version:", pa.__version__)

输出应如下,显示 pandas 和 Pandera 的版本,确认安装成功:

pandas version: 2.2.2
pandera version: 0.0.0+dev0

第 2 步:创建示例数据集

让我们创建一个包含有意错误的客户信息数据集,便于演示清洗和验证流程:

import pandas as pd

# 包含错误的客户数据集
data = pd.DataFrame({
    "customer_id": [1, 2, 3, 4, "invalid"],  # "invalid" 不是整数
    "name": ["Maryam", "Jane", "", "Alice", "Bobby"],  # 包含空名字
    "age": [25, -5, 30, 45, 35],  # 年龄为负数无效
    "email": ["mrym@gmail.com", "jane.s@yahoo.com", "invalid_email", "alice@google.com", None]  # 邮箱无效或缺失
})

print("原始 DataFrame:")
print(data)

输出:

原始 DataFrame:
  customer_id    name  age             email
0           1  Maryam   25    mrym@gmail.com
1           2    Jane   -5  jane.s@yahoo.com
2           3           30     invalid_email
3           4   Alice   45  alice@google.com
4     invalid   Bobby   35              None

数据集中的问题:

  • customer_id
  • :包含字符串 "invalid",应为整数
  • name
  • :存在空字符串
  • age
  • :包含负数(-5)
  • email
  • :格式无效(invalid_email)和缺失值(None)

第 3 步:定义 Pandera Schema

Pandera 的 schema 定义了 DataFrame 期望的结构和约束。我们将用 DataFrameSchema 为每一列指定规则:

import pandera as pa
from pandera import Column, Check, DataFrameSchema

# 定义 schema
schema = DataFrameSchema({
    "customer_id": Column(
        dtype="int64",
        checks=[
            Check.isin(range(1, 1000)),  # ID 在 1~999 之间
            Check(lambda x: x > 0, element_wise=True)  # 必须为正数
        ],
        nullable=False
    ),
    "name": Column(
        dtype="string",
        checks=[
            Check.str_length(min_value=1),
            Check(lambda x: x.strip() != "", element_wise=True)
        ],
        nullable=False
    ),
    "age": Column(
        dtype="int64",
        checks=[
            Check.greater_than(0),  # 必须为正
            Check.less_than_or_equal_to(120)  # 合理范围
        ],
        nullable=False
    ),
    "email": Column(
        dtype="string",
        checks=[
            Check.str_matches(r"^[a-zA-Z0-9_.+-]+@[a-zA-Z0-9-]+\.[a-zA-Z0-9-.]+#34;)
        ],
        nullable=False
    )
})

第 4 步:初始验证

现在,用 schema 验证 DataFrame。Pandera 的 validate 方法会检查数据是否符合 schema,设置 lazy=True 可收集所有错误:

print("\n初始验证:")
try:
    validated_df = schema.validate(data, lazy=True)
    print("数据有效!")
    print(validated_df)
except pa.errors.SchemaErrors as e:
    print("验证失败,具体问题如下:")
    print(e.failure_cases[['column', 'check', 'failure_case', 'index']])

验证会失败,错误信息类似:

验证失败,具体问题如下:
        column                check         failure_case index
0  customer_id   isin(range(1, 1000))            invalid     4
1         name      str_length(1, None)                        2
2         name                                    2
3          age           greater_than(0)                -5     1
4        email              not_nullable              None     4
5        email  str_matches('...')      invalid_email     2
6  customer_id             dtype('int64')           object  None
...

第 5 步:清洗数据

我们已发现问题,接下来逐步清洗数据:

  • customer_id
  • :移除非整数或无效 ID
  • name
  • :移除空字符串
  • age
  • :移除负数或不合理年龄
  • email
  • :移除无效或缺失邮箱
# 5a. 清洗 customer_id
data["customer_id"] = pd.to_numeric(data["customer_id"], errors="coerce")
data = data[data["customer_id"].notna()]
data = data[data["customer_id"].isin(range(1, 1000))]
data["customer_id"] = data["customer_id"].astype("int64")

# 5b. 清洗 name
data = data[data["name"].str.strip() != ""]
data["name"] = data["name"].astype("string[python]")

# 5c. 清洗 age
data = data[data["age"] > 0]
data = data[data["age"] <= 120]

# 5d. 清洗 email
data = data[data["email"].notna()]
data = data[data["email"].str.match(r"^[a-zA-Z0-9_.+-]+@[a-zA-Z0-9-]+\.[a-zA-Z0-9-.]+#34;)]
data["email"] = data["email"].astype("string[python]")

print("清洗后的 DataFrame:")
print(data)

清洗后 DataFrame:

清洗后的 DataFrame:
   customer_id    name  age             email
0            1  Maryam   25    mrym@gmail.com
3            4   Alice   45  alice@google.com

第 6 步:再次验证数据

验证清洗后的 DataFrame,确保其符合 schema:

print("\n最终验证:")
try:
    validated_df = schema.validate(data, lazy=True)
    print("清洗后的数据有效!")
    print(validated_df)
except pa.errors.SchemaErrors as e:
    print("清洗后验证失败,错误如下:")
    print(e.failure_cases[['column', 'check', 'failure_case', 'index']])

输出:

最终验证:
清洗后的数据有效!
   customer_id    name  age             email
0            1  Maryam   25    mrym@gmail.com
3            4   Alice   45  alice@google.com

第 7 步:构建可复用的数据处理管道

可以将清洗和验证流程封装为可复用的函数:

def process_data(df, schema):
    """
    用 Pandera schema 处理并验证 DataFrame。
    参数:
        df: 输入的 pandas DataFrame
        schema: Pandera DataFrameSchema
    返回:
        验证且清洗后的 DataFrame,若验证失败则返回 None
    """
    data_clean = df.copy()

    data_clean["customer_id"] = pd.to_numeric(data_clean["customer_id"], errors="coerce")
    data_clean = data_clean[data_clean["customer_id"].notna()]
    data_clean = data_clean[data_clean["customer_id"].isin(range(1, 1000))]
    data_clean["customer_id"] = data_clean["customer_id"].astype("int64")

    data_clean = data_clean[data_clean["name"].str.strip() != ""]
    data_clean["name"] = data_clean["name"].astype("string")

    data_clean = data_clean[data_clean["age"] > 0]
    data_clean = data_clean[data_clean["age"] <= 120]
    data_clean["age"] = data_clean["age"].astype("int64")

    data_clean = data_clean[data_clean["email"].notna()]
    data_clean = data_clean[data_clean["email"].str.match(r"^[a-zA-Z0-9_.+-]+@[a-zA-Z0-9-]+\.[a-zA-Z0-9-.]+#34;)]
    data_clean["email"] = data_clean["email"].astype("string")

    data_clean = data_clean.reset_index(drop=True)

    try:
        validated_df = schema.validate(data_clean, lazy=True)
        print("数据处理成功!")
        return validated_df
    except pa.errors.SchemaErrors as e:
        print("清洗后验证失败,错误如下:")
        print(e.failure_cases[['column', 'check', 'failure_case', 'index']])
        return None

# 测试管道
print("\n测试管道:")
final_df = process_data(data, schema)
print("最终处理后的 DataFrame:")
print(final_df)

输出:

测试管道:
数据处理成功!
最终处理后的 DataFrame:
   customer_id    name  age             email
0            1  Maryam   25    mrym@gmail.com
1            4   Alice   45  alice@google.com

结论

Pandera 是保障 pandas 数据工作流数据质量的强大工具。通过定义 schema,你能及早发现错误,强制执行数据一致性,并自动化数据清洗。本文你学到了:

  • 安装 Pandera 并设置样例数据集
  • 定义包含类型和约束规则的 schema
  • 验证数据并定位问题
  • 清洗数据以符合 schema
  • 再次验证清洗后的数据
  • 构建可复用的数据处理管道

Pandera 还支持更复杂的验证场景,例如基于类的 schema、跨字段校验、局部校验等,详情可参见官方 Pandera 文档。

相关推荐

大文件传不动?WinRAR/7-Zip 入门到高手,这 5 个技巧让你效率翻倍

“这200张照片怎么传给女儿?微信发不了,邮箱附件又超限……”62岁的张阿姨对着电脑犯愁时,儿子只用了3分钟就把照片压缩成一个文件,还教她:“以后用压缩软件,比打包行李还方便!”职场人更懂这...

电脑解压缩软件推荐——7-Zip:免费、高效、简洁的文件管理神器

在日常工作中,我们经常需要处理压缩文件。无论是下载软件包、接收文件,还是存储大量数据,压缩和解压缩文件都成为了我们日常操作的一部分。而说到压缩解压软件,7-Zip绝对是一个不可忽视的名字。今天,我就来...

设置了加密密码zip文件要如何打开?这几个方法可以试试~

Zip是一种常见的压缩格式文件,文件还可以设置密码保护。那设置了密码的Zip文件要如何打开呢?不清楚的小伙伴一起来看看吧。当我们知道密码想要打开带密码的Zip文件,我们需要用到适用于Zip格式的解压缩...

大文件想要传输成功,怎么把ZIP文件分卷压缩

不知道各位小伙伴有没有这样的烦恼,发送很大很大的压缩包会受到限制,为此,想要在压缩过程中将文件拆分为几个压缩包并且同时为所有压缩包设置加密应该如何设置?方法一:使用7-Zip免费且强大的文件管理工具7...

高效处理 RAR 分卷压缩包:合并解压操作全攻略

在文件传输和存储过程中,当遇到大文件时,我们常常会使用分卷压缩的方式将其拆分成多个较小的压缩包,方便存储和传输。RAR作为一种常见的压缩格式,分卷压缩包的使用频率也很高。但很多人在拿到RAR分卷...

2个方法教你如何删除ZIP压缩包密码

zip压缩包设置了加密密码,每次解压文件都需要输入密码才能够顺利解压出文件,当压缩包文件不再需要加密的时候,大家肯定想删除压缩包密码,或是忘记了压缩包密码,想要通过删除操作将压缩包密码删除,就能够顺利...

速转!漏洞预警丨压缩软件Winrar目录穿越漏洞

WinRAR是一款功能强大的压缩包管理器,它是档案工具RAR在Windows环境下的图形界面。该软件可用于备份数据,缩减电子邮件附件的大小,解压缩从Internet上下载的RAR、ZIP及其它类...

文件解压方法和工具分享_文件解压工具下载

压缩文件减少文件大小,降低文件失效的概率,总得来说好处很多。所以很多文件我们下载下来都是压缩软件,很多小伙伴不知道怎么解压,或者不知道什么工具更好,所以今天做了文件解压方法和工具的分享给大家。一、解压...

[python]《Python编程快速上手:让繁琐工作自动化》学习笔记3

1.组织文件笔记(第9章)(代码下载)1.1文件与文件路径通过importshutil调用shutil模块操作目录,shutil模块能够在Python程序中实现文件复制、移动、改名和删除;同时...

Python内置tarfile模块:读写 tar 归档文件详解

一、学习目标1.1学习目标掌握Python内置模块tarfile的核心功能,包括:理解tar归档文件的原理与常见压缩格式(gzip/bz2/lzma)掌握tar文件的读写操作(创建、解压、查看、过滤...

使用python展开tar包_python拓展

类Unix的系统,打包文件经常使用的就是tar包,结合zip工具,可以方便的打包并解压。在python的标准库里面有tarfile库,可以方便实现生成了展开tar包。使用这个库最大的好处,可能就在于不...

银狐钓鱼再升级:白文件脚本化实现GO语言后门持久驻留

近期,火绒威胁情报中心监测到一批相对更为活跃的“银狐”系列变种木马。火绒安全工程师第一时间获取样本并进行分析。分析发现,该样本通过阿里云存储桶下发恶意文件,采用AppDomainManager进行白利...

ZIP文件怎么打开?2个简单方法教你轻松搞定!

在日常工作和生活中,我们经常会遇到各种压缩文件,其中最常见的格式之一就是ZIP。ZIP文件通过压缩数据来减少文件大小,方便我们进行存储和传输。然而,对于初学者来说,如何打开ZIP文件可能会成为一个小小...

Ubuntu—解压多个zip压缩文件.zip .z01 .z02

方法将所有zip文件放在同一目录中:zip_file.z01,zip_file.z02,zip_file.z03,...,zip_file.zip。在Zip3.0版本及以上,使用下列命令:将所有zi...

如何使用7-Zip对文件进行加密压缩

7-Zip是一款开源的文件归档工具,支持多种压缩格式,并提供了对压缩文件进行加密的功能。使用7-Zip可以轻松创建和解压.7z、.zip等格式的压缩文件,并且可以通过设置密码来保护压缩包中的...

取消回复欢迎 发表评论: