当前位置:首页>python>Python 数据清洗入门:用 pandas 告别脏数据

Python 数据清洗入门:用 pandas 告别脏数据

  • 2026-09-16 20:26:18
Python 数据清洗入门:用 pandas 告别脏数据
你是否曾经拿到一个 Excel 表格,打开后却发现:有的单元格是空的,有的日期格式乱七八糟,同一列里数字还带着美元符号,甚至好几行数据完全重复?如果直接拿这样的数据去做分析或建模,结果很可能是一团糟。数据清洗,就是把这些“脏数据”变成干净、规范的数据集的过程。在 Python 中,pandas 和 numpy 是处理这类问题的利器。本文将从零开始,带你一步步学会用 pandas 清洗常见的数据问题,并最终封装成一个可复用的自动化函数。

常见的数据脏乱问题

在开始动手之前,我们先来认识一下最常见的三类数据问题:

  • 缺失值:数据集中某些字段为空(NaN)。比如用户的年龄没填、订单金额缺失。
  • 重复值:完全相同的记录出现多次。可能是系统重复录入,或者合并数据时产生的冗余。
  • 格式不一致:同一字段的数据表示方式五花八门。例如日期有的写 2023-01-01,有的写 01/02/2023;金额有的带 $,有的不带;分类标签大小写混用。

如果不处理这些问题,后续的分析结果会严重失真。而 pandas 提供了非常直观的方法来解决它们。

工具简介:pandas 与 numpy

  • pandas:提供了 DataFrame 和 Series 结构,内置了 dropna、fillna、drop_duplicates、replace、str 访问器等大量数据清洗方法。
  • numpy:提供底层的数值运算,常用来标记缺失值(np.nan)和进行数值转换。

两者结合,可以高效地完成大部分清洗任务。

实战:从混乱到干净

为了让你看得更清楚,我们先构造一个包含上述所有问题的模拟数据集,然后逐步清洗它。

1. 构造含问题数据

import pandas as pdimport numpy as npdata = {    'ID': [1, 2, 2, 3, 4, 5, 5, 6],    'Name': ['Alice', 'Bob', 'Bob', 'Charlie', 'David', 'Eve', 'Eve', 'Frank'],    'Date': ['2023-01-01', '01/02/2023', '01/02/2023', '2023-03-01', '03-04-2023', '2023/05/01', '2023/05/01', '2023-06-01'],    'Amount': ['$100', '200', '200', np.nan, '$400', '500', '500', '600'],    'Category': ['A', 'b', 'B', 'c', 'C', 'D', 'd', 'E']}df = pd.DataFrame(data)print(”原始数据:”)print(df)

输出:

ID     Name        Date Amount Category0   1    Alice  2023-01-01   $100        A1   2      Bob  01/02/2023    200        b2   2      Bob  01/02/2023    200        B3   3  Charlie  2023-03-01    NaN        c4   4    David  03-04-2023   $400        C5   5      Eve  2023/05/01    500        D6   5      Eve  2023/05/01    500        d7   6    Frank  2023-06-01    600        E

一眼就能看出问题:

  • 重复值:ID 为 2 和 5 的记录出现了两次(虽然 Category 大小写不同,但其他字段相同)。
  • 缺失值:ID=3 的 Amount 是 NaN。
  • 格式不一致:Date 列使用了 -、/、. 等多种分隔符,顺序也不统一;Amount 列有的带 $ 符号;Category 列大小写混杂。

2. 处理缺失值

缺失值处理通常有两种策略:删除(如果缺失比例太高)或填充。对于数值型字段,常用中位数或均值填充;对于分类型字段,常用众数填充或标记为“Unknown”。

本例中,Amount 应该是数值,所以我们先去掉 $ 符号,转换成数值,然后用中位数填充缺失值。

# 去除 $ 符号并转换为数值df['Amount'] = df['Amount'].str.replace('$', '', regex=False)df['Amount'] = pd.to_numeric(df['Amount'], errors='coerce')# 用中位数填充缺失值median_amount = df['Amount'].median()df['Amount'].fillna(median_amount, inplace=True)print(”缺失值处理后:”)print(df[['ID', 'Amount']])

输出:

ID  Amount0   1   100.01   2   200.02   2   200.03   3   350.0# 中位数填充4   4   400.05   5   500.06   5   500.07   6   600.0

小提示:pd.to_numeric 的 errors='coerce' 参数会将无法转换的值变成 NaN,非常安全。

3. 处理重复值

完全重复的行通常只保留第一条。但要注意,这里的重复行中 Category 大小写不同,所以并不是“完全重复”。如果我们想基于 ID 来判断重复,可以用 subset 参数。这里我们先保留所有行,后面统一大小写后再去重会更合理。

不过为了演示 drop_duplicates 的效果,我们先看看重复记录:

duplicates = df[df.duplicated(keep=False)]print(”重复记录(所有列完全一致):”)print(duplicates)

输出:

ID Name        Date  Amount Category1   2  Bob  01/02/2023   200.0        b2   2  Bob  01/02/2023   200.0        B5   5  Eve  2023/05/01   500.0        D6   5  Eve  2023/05/01   500.0        d

可以看到,ID=2 的两行因为 Category 不同(b vs B),并没有被标记为完全重复;ID=5 同理。如果我们现在用 drop_duplicates(),它们不会被删除。我们会在后面统一大小写后再处理重复。

4. 处理格式不一致

日期格式混乱是家常便饭。我们可以写一个简单的解析函数,尝试多种常见格式,最后统一输出为 YYYY-MM-DD。

def parse_date(date_str):    for fmt in ('%Y-%m-%d', '%m/%d/%Y', '%d-%m-%Y', '%Y/%m/%d'):        try:            return pd.to_datetime(date_str, format=fmt)        except:            continue    return pd.NaTdf['Date'] = df['Date'].apply(parse_date)df['Date'] = df['Date'].dt.strftime('%Y-%m-%d')print(”日期统一后:”)print(df[['ID', 'Date']])

输出:

ID        Date0   1  2023-01-011   2  2023-01-022   2  2023-01-023   3  2023-03-014   4  2023-04-035   5  2023-05-016   5  2023-05-017   6  2023-06-01

所有日期都变成了标准格式,非常清爽。

Category 列应该统一为大写(或小写),这样后续分组统计才不会出错。

df['Category'] = df['Category'].str.upper()print(”Category 统一后:”)print(df[['ID', 'Category']])

输出:

ID Category0   1        A1   2        B2   2        B3   3        C4   4        C5   5        D6   5        D7   6        E

现在,ID=2 的两行 Category 都变成了 B,ID=5 的两行都变成了 D。这时候再删除完全重复的行,它们就会被识别并移除。

现在所有列都一致了,可以放心删除完全重复的行:

df.drop_duplicates(inplace=True)print(”删除重复后:”)print(df)

输出:

ID     Name        Date  Amount Category0   1    Alice  2023-01-01   100.0        A1   2      Bob  2023-01-02   200.0        B3   3  Charlie  2023-03-01   350.0        C4   4    David  2023-04-03   400.0        C5   5      Eve  2023-05-01   500.0        D7   6    Frank  2023-06-01   600.0        E

现在数据干净多了:没有缺失值,没有重复行,所有格式统一。

5. 最终检查与保存

清洗完成后,检查一下数据类型和基本信息:

print(”清洗后数据信息:”)df.info()

输出:

Int64Index: 6 entries, 0 to 7Data columns (total 5 columns):#   Column    Non-Null Count  Dtype---  ------    --------------  ----- 0   ID        6 non-null      int64 1   Name      6 non-null      object 2   Date      6 non-null      object 3   Amount    6 non-null      float64 4   Category  6 non-null      objectdtypes: float64(1), int64(1), object(3)

所有列都没有缺失值,Amount 变成了 float64,适合后续计算。最后将清洗后的数据保存为 CSV 文件:

df.to_csv('cleaned_data.csv', index=False)print(”清洗数据已保存至 cleaned_data.csv”)

封装自动化清洗函数

上面的步骤虽然清晰,但每次都要手动写一遍太麻烦。我们可以把它们封装成一个函数,以后只要传入原始 DataFrame,就能自动完成清洗。

def auto_clean_data(df):    ”””    自动清洗数据框,处理缺失值、重复值、格式不一致。    返回清洗后的 DataFrame。    ”””    df = df.copy()# 1. 处理数值列中的特殊符号并转换为数值    for col in df.select_dtypes(include=['object']).columns:        if df[col].str.contains(r'[\$€¥]', na=False).any():            df[col] = df[col].str.replace(r'[\$€¥]', '', regex=True)            df[col] = pd.to_numeric(df[col], errors='coerce')# 2. 缺失值处理:数值列用中位数填充,分类型用众数填充    for col in df.columns:        if df[col].dtype in ['int64', 'float64']:            df[col].fillna(df[col].median(), inplace=True)        elif df[col].dtype == 'object':# 尝试解析日期            if df[col].str.match(r'\d{4}[-/]\d{2}[-/]\d{2}|\d{2}[-/]\d{2}[-/]\d{4}', na=False).any():                df[col] = pd.to_datetime(df[col], errors='coerce')                df[col] = df[col].dt.strftime('%Y-%m-%d')            else:                df[col].fillna(df[col].mode()[0] if not df[col].mode().empty else 'Unknown', inplace=True)# 统一大小写                df[col] = df[col].str.upper()# 3. 删除完全重复的行    df.drop_duplicates(inplace=True)# 4. 重置索引    df.reset_index(drop=True, inplace=True)    return df# 测试自动化函数df_original = pd.DataFrame(data)# 重新加载原始数据df_cleaned = auto_clean_data(df_original)print(”自动化清洗结果:”)print(df_cleaned)

输出和之前的手动清洗结果一致。这个函数可以作为一个基础模板,根据实际业务需求调整填充策略、日期格式等。

高级技巧与注意事项

  • 缺失值插值:对于时间序列数据,可以使用 df.interpolate() 进行线性插值,比简单填充更平滑。
  • 重复值基于子集:如果业务上认为某些列相同即为重复(如 ID),可以用 df.drop_duplicates(subset=['ID'])。
  • 正则表达式批量替换:str.replace 支持正则,可以一次清理多种符号,比如 df['Amount'].str.replace(r'[\$€¥]', '', regex=True)。
  • 数据类型推断:pd.to_datetime 和 pd.to_numeric 配合 errors='coerce' 可以安全转换,不会因为个别错误导致整个程序崩溃。
  • 内存优化:对于大型数据集,使用 dtype 参数指定列类型(如 category、int32)可以显著降低内存占用。

总结

数据清洗是数据分析中绕不开的一步,但用 pandas 处理起来非常高效。本文从构造脏数据开始,逐步演示了缺失值填充、重复值删除、日期统一、大小写标准化等常见操作,最后封装成了一个自动化函数。掌握了这些基础,你就能在几分钟内把一团乱麻的数据整理得井井有条,为后续的分析和建模打下坚实基础。

如果你在实际工作中遇到了更复杂的清洗需求(比如多表合并后的重复、异常值检测等),可以在这个基础上继续扩展。希望这篇文章能帮你告别脏数据,让 Python 成为你数据清洗的得力助手!


附录:完整可运行代码

以下是将所有步骤整合在一起的完整代码,可以直接复制到 Jupyter Notebook 或 Python 脚本中运行。

import pandas as pdimport numpy as np# 1. 构造含问题数据data = {    'ID': [1, 2, 2, 3, 4, 5, 5, 6],    'Name': ['Alice', 'Bob', 'Bob', 'Charlie', 'David', 'Eve', 'Eve', 'Frank'],    'Date': ['2023-01-01', '01/02/2023', '01/02/2023', '2023-03-01', '03-04-2023', '2023/05/01', '2023/05/01', '2023-06-01'],    'Amount': ['$100', '200', '200', np.nan, '$400', '500', '500', '600'],    'Category': ['A', 'b', 'B', 'c', 'C', 'D', 'd', 'E']}df = pd.DataFrame(data)print(”=== 原始数据 ===”)print(df)# 2. 缺失值处理df['Amount'] = df['Amount'].str.replace('$', '', regex=False)df['Amount'] = pd.to_numeric(df['Amount'], errors='coerce')median_amount = df['Amount'].median()df['Amount'].fillna(median_amount, inplace=True)print(”\n=== 缺失值处理后 ===”)print(df)# 3. 重复值处理df.drop_duplicates(inplace=True)print(”\n=== 删除重复后 ===”)print(df)# 4. 格式不一致处理# 日期统一def parse_date(date_str):    for fmt in ('%Y-%m-%d', '%m/%d/%Y', '%d-%m-%Y', '%Y/%m/%d'):        try:            return pd.to_datetime(date_str, format=fmt)        except:            continue    return pd.NaTdf['Date'] = df['Date'].apply(parse_date)df['Date'] = df['Date'].dt.strftime('%Y-%m-%d')# 分类大小写统一df['Category'] = df['Category'].str.upper()print(”\n=== 格式统一后 ===”)print(df)# 5. 保存结果df.to_csv('cleaned_data.csv', index=False)print(”\n清洗数据已保存至 cleaned_data.csv”)# 自动化函数示例def auto_clean_data(df):    df = df.copy()    for col in df.select_dtypes(include=['object']).columns:        if df[col].str.contains(r'[\$€¥]', na=False).any():            df[col] = df[col].str.replace(r'[\$€¥]', '', regex=True)            df[col] = pd.to_numeric(df[col], errors='coerce')    for col in df.columns:        if df[col].dtype in ['int64', 'float64']:            df[col].fillna(df[col].median(), inplace=True)        elif df[col].dtype == 'object':            if df[col].str.match(r'\d{4}[-/]\d{2}[-/]\d{2}|\d{2}[-/]\d{2}[-/]\d{4}', na=False).any():                df[col] = pd.to_datetime(df[col], errors='coerce')                df[col] = df[col].dt.strftime('%Y-%m-%d')            else:                df[col].fillna(df[col].mode()[0] if not df[col].mode().empty else 'Unknown', inplace=True)                df[col] = df[col].str.upper()    df.drop_duplicates(inplace=True)    df.reset_index(drop=True, inplace=True)    return df# 测试自动化函数df_test = pd.DataFrame(data)df_auto = auto_clean_data(df_test)print(”\n=== 自动化清洗结果 ===”)print(df_auto)

现在,你可以把这个脚本保存下来,以后遇到类似的脏数据,直接调用 auto_clean_data 函数就能快速搞定。快去试试吧!

最新文章

随机文章