本章是三级人工智能训练师数字数据处理核心章节,理论卷面分值占比 18%,上机实操分值高达 30%,是顺利拿证的关键板块。本章遵循「环境认知→基础语法→数值计算库→表格处理库→可视化拓展」标准教学逻辑,先完整吃透理论概念,再配套实操代码巩固练习,适配零基础备考学员循序渐进学习。
2.1 Python 开发环境理论详解
2.1.1 Anaconda 集成开发环境概念
数据分析、AI 训练行业通用标准集成套装,内置 Python 官方解释器、Numpy/Pandas/Matplotlib 等上百款预装第三方库,配套 conda 虚拟环境管理工具、pip 包安装工具,是本次职业技能等级考试统一指定运行环境。
2.1.2 两款编辑器理论区分(选择题高频考点)
- Jupyter Notebook:网页交互式运行文件,后缀为.ipynb,支持分段执行代码、插入文字学习笔记,适合日常代码调试;短板无法开发大型完整项目脚本;
- PyCharm 专业编辑器:生成标准.py 完整脚本文件,自带强语法校验、智能代码提示功能,是正式实操考试推荐作答工具。
2.1.3 pip 包管理工具理论考点
pip 是 Python 官方第三方拓展库专用命令行管理工具,三条核心命令为理论单选、实操填空必考内容,分别实现库安装、已安装库查询、旧版本库升级。
2.1.4 虚拟环境核心理论知识点
核心功能为项目运行环境隔离,不同项目使用的依赖库、版本互不干扰;行业标准化开发规范要求一套 AI 项目对应一套独立虚拟环境,从根源规避库版本冲突导致的代码报错。
2.2 Python 基础语法理论详解
2.2.1 基础数据存储类型
- 数值类型:int 整数、float 浮点数,仅支持数值加减乘除运算;
- 字符串 str:使用英文单 / 双引号包裹文本内容,用于存储样本标签、文本描述类数据;
- 布尔 bool:仅存在 True、False 两种固定取值,作为条件判断逻辑的基础依据。
2.2.2 四大容器数据结构(理论核心大题)
- 列表 list []:有序存储、允许重复元素、支持随时增删修改;
- 元组 tuple ():有序存储、允许重复元素,定义完成后无法修改内部任意数据;
- 字典 dict {key:value}:键值对结构化存储,key 字段名称唯一不可重复;
- 集合 set {}:无序存储,写入重复数据会自动剔除,数据去重场景首选工具。
2.2.3 三大程序逻辑语句理论说明
- if/elif/else 条件分支:依据自定义条件划分数据、执行差异化操作;
- for 循环:批量遍历列表、数据集每行样本,实操考核频次最高;while 循环考核占比极低,仅需了解概念;
- def 自定义函数:封装重复复用代码,减少脚本冗余内容,考试仅要求识别基础结构。
2.3 Numpy 数值运算库理论与基础代码
2.3.1 库定位理论说明
Numerical Python 专门处理多维同规格数组,批量数值运算效率远高于 Python 原生 list 列表,广泛应用于图像像素处理、模型数值特征计算,标准导入代码:import numpy as np
2.3.2 数组创建、属性相关理论
数组三种创建方式:普通列表转换、生成连续范围数组、生成固定长度全零 / 全 1 数组;三大核心属性:.shape 返回数组行列尺寸、.ndim 查看数组维度数量、.dtype 识别数组内部存储数据类型;缺失值统一标识 np.nan,代表原始数据中的空白无效内容,是数据清洗环节重点处理对象。
2.4 Pandas 数据分析库
2.4.1 两大数据结构理论定义
- Series 一维序列:仅承载单列数据,等同于 Excel 单一字段;
- DataFrame 二维表格:完全对标 Excel 整张表格,一行代表一条训练样本,一列代表数据特征字段,绝大多数标注完成的 AI 数据集均采用该结构存储,导入语句必考默写:import pandas as pd
2.4.2 数据集读写理论规范
读取 csv、Excel 文件时,中文文件必须添加 utf-8 编码参数防止乱码;导出 CSV 文件必须携带 index=False 屏蔽系统自带行索引,encoding="utf-8-sig" 解决 Windows 系统中文乱码,两项参数属于实操硬性得分点。
2.4.3 数据选取、条件筛选语法规则
单列、多列字段提取基础语法;多条件联合筛选规则:& 代表同时满足、| 代表满足任意一个条件,每一个独立条件必须使用英文小括号包裹,括号缺失会直接造成代码运行报错。
2.4.4 全套数据集清洗理论方案
- 缺失值处理两类方案:删除含空值整行、数值字段均值填充,分别适配样本充足、样本稀缺两种场景;
- 重复样本处理:drop_duplicates () 剔除重复标注数据,避免模型训练出现过拟合问题;
- 字段管理操作:删除无用特征列、批量修改字段名称适配业务需求。
2.5 Matplotlib 可视化工具与拓展 AI 工具认知
- Matplotlib 可视化库:折线图观测数据连续变化趋势、模型训练损失曲线;柱状图统计各分类样本数量,判断数据集样本均衡程度;
- jieba 中文分词工具:NLP 文本预处理专用,拆分完整中文长句为独立词语;
- OpenCV/PIL 图像库:完成图片读取、缩放、裁剪、翻转、降噪等视觉数据预处理;
- scikit-learn 机器学习工具包:第四章机器学习模型搭建的核心工具。
2.6 完整实操代码模板
标准数据集清洗完整脚本
python
# 导入Pandas数据分析库import pandas as pd# 读取本地原始训练数据集df = pd.read_csv("data.csv",encoding="utf-8")# 第一步清除全部重复样本行df = df.drop_duplicates()# 第二步删除带有缺失值的样本数据df = df.dropna(axis=0)# 第三步按照考核业务条件筛选合格样本clean_df = df[df["score"]>=60]# 第四步导出标准化清洗完成数据集clean_df.to_csv("clean_data.csv",index=False,encoding="utf-8-sig")
本章理论考点汇总
- 开发环境区分:Anaconda 为考试指定运行环境,PyCharm 适合考场完整脚本作答;
- Python 四大容器特性为选择题高频考点,集合自动去重是必区分知识点;
- Numpy 数组运算效率优于原生 list,np.nan 统一代表缺失空白数据;
- Pandas 读写文件的两个导出关键参数是实操必写内容;
- 缺失值、重复样本两类数据清洗处理方案为实操大题核心考点。