

这篇文章会结合pandas当中的常用方法,完整拆解一套可以直接应用的数据清洗流程,帮助你把格式杂乱、内容重复以及字段不统一的Excel和CSV原始数据,逐步整理成结构统一、口径清晰,并且能够继续用于统计分析的标准数据集。
一、脏数据到底脏在哪?——我们先识别问题,再决定清洗规则
⭐重复、缺失、格式混乱,都会让统计结果失真

⭐同一业务对象是否重复,取决于你用什么字段识别它。

三、补空值,别一上来就填0——字段类型不同,补值策略也不同
⭐先把伪空值变成真正的缺失值,再决定删、填还是保留。

⭐空格、大小写、别名不统一,会把同一类别拆成很多类。

(能计算、能排序、能按时间分析,才算真的清洗好)
⭐格式统一的目标,不是好看,而是能被正确解析和计算。

⭐真正专业的数据清洗,不止改数据,还要验证结果是否可信。
