🐍 Python Day85:机器学习概念 — AI 的入门钥匙
🕐 预计用时:3-4 小时 | 🎯 目标:理解机器学习的三大类型、特征工程、训练/测试集和模型评估
📖 今日目录
1. 机器学习是什么?
# 传统编程:人写规则 → 计算机执行
# 输入数据 + 规则(代码) → 输出结果
# 机器学习:计算机从数据中学习规则
# 输入数据 + 已知结果 → 计算机学习规则 → 用规则预测新数据
# 生活中的例子:
# 传统编程:人写 if-else 判断垃圾邮件
# 机器学习:给计算机 10000 封邮件(标记了垃圾/正常)→ 它自己学会判断规则
# 为什么需要机器学习?
# 1. 规则太复杂:人脸识别、语音识别,人写不出规则
# 2. 规则会变化:用户行为、市场趋势,规则需要动态更新
# 3. 数据量太大:百万条数据,人工分析不现实
2. 三大类型
📋 监督学习(Supervised Learning)
# 数据有"标签"(正确答案),模型学习从输入到输出的映射
# 类比:老师给学生做题并讲解答案,学生学会做题方法
# 分类(Classification):预测离散类别
# 例:邮件是否是垃圾邮件(是/否)
# 例:图片中的动物是什么(猫/狗/鸟)
# 例:用户会不会购买(买/不买)
# 回归(Regression):预测连续数值
# 例:预测房价(多少万)
# 例:预测销售额(多少元)
# 例:预测考试成绩(多少分)
📋 无监督学习(Unsupervised Learning)
# 数据没有"标签",模型自己发现数据的结构和规律
# 类比:没有老师,学生自己观察、分类、总结
# 聚类(Clustering):自动分组
# 例:客户分群(高价值/中价值/低价值)
# 例:新闻自动分类
# 例:异常检测(找出离群点)
# 降维(Dimensionality Reduction):压缩数据
# 例:把 100 个特征压缩为 10 个主要特征
# 例:数据可视化(高维数据投影到 2D/3D)
📋 强化学习(Reinforcement Learning)
# 模型通过"试错"学习,在环境中获得奖励或惩罚
# 类比:训练小狗——做好动作给零食,做错动作不给
# 应用:
# AlphaGo 下围棋
# 自动驾驶
# 游戏 AI
# 机器人控制
| | | |
|---|
| | | |
| | | |
| | | Q-Learning、Policy Gradient |
3. 核心概念
# 机器学习的基本流程:
# 1. 收集数据(如历史销售数据)
# 2. 数据预处理(清洗、特征工程)
# 3. 选择模型(如线性回归)
# 4. 训练模型(让模型学习数据中的规律)
# 5. 评估模型(用测试数据检验模型效果)
# 6. 调优模型(调整参数,提升效果)
# 7. 部署预测(用模型对新数据做预测)
# 核心术语:
# 特征(Feature) → 输入变量(如面积、楼层、房龄)
# 标签(Label) → 输出变量(如房价)
# 样本(Sample) → 一条数据(如一套房子的数据)
# 模型(Model) → 学到的规则(数学函数)
# 训练(Training) → 用数据让模型学习
# 预测(Prediction) → 用模型对新数据做推断
# 示例:预测房价
# 特征(X):面积、楼层、房龄、地铁距离、学区
# 标签(y):房价(万元)
# 训练数据:
# 面积 楼层 房龄 地铁距离 学区 → 房价
# 90 15 5 500 是 → 350
# 120 8 10 1000 否 → 280
# 60 25 2 200 是 → 420
# ...
# 模型学习到的"规则"(简化版):
# 房价 ≈ 面积 × 3 + 楼层 × 2 - 房龄 × 5 - 地铁距离 × 0.01 + 学区 × 50
# 用这个规则预测新房子的价格
# 新房:面积100, 楼层12, 房龄3, 地铁300m, 学区
# 预测房价 ≈ 100×3 + 12×2 - 3×5 - 300×0.01 + 50 = 356万
4. 数据准备
import pandas as pd
import numpy as np
# === 加载数据 ===
# 方式1:从 CSV 加载
df = pd.read_csv('house_prices.csv')
# 方式2:用 Scikit-learn 内置数据集
from sklearn.datasets import load_iris, fetch_california_housing
# 注意:load_boston 已在 scikit-learn 1.2 中被移除,推荐用 fetch_california_housing 做回归
# 鸢尾花数据集(分类)
iris = load_iris()
print(f'特征名: {iris.feature_names}') # ['sepal length', ...]
print(f'标签名: {iris.target_names}') # ['setosa', 'versicolor', 'virginica']
print(f'数据形状: {iris.data.shape}') # (150, 4)
print(f'标签形状: {iris.target.shape}') # (150,)
# 转为 DataFrame 方便操作
df = pd.DataFrame(iris.data, columns=iris.feature_names)
df['species'] = iris.target
print(df.head())
# === 数据探索 ===
print(df.shape) # 行列数
print(df.dtypes) # 数据类型
print(df.describe()) # 统计摘要
print(df.isnull().sum()) # 缺失值
5. 特征工程
特征工程是机器学习中最重要的环节——好的特征比复杂的模型更有效。
import pandas as pd
import numpy as np
# === 1. 缺失值处理 ===
df['年龄'] = df['年龄'].fillna(df['年龄'].median()) # 中位数填充
df['城市'] = df['城市'].fillna('未知') # 固定值填充
# === 2. 特征缩放 ===
# 很多模型对特征的尺度敏感(如 KNN、SVM、神经网络)
# 面积: 60-200 vs 地铁距离: 200-5000 → 尺度差异太大
# 标准化(Z-Score):均值为0,标准差为1
from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)
# 归一化(Min-Max):缩放到 [0, 1]
from sklearn.preprocessing import MinMaxScaler
scaler = MinMaxScaler()
X_scaled = scaler.fit_transform(X)
# === 3. 类别特征编码 ===
# 机器学习模型只能处理数字,不能处理文字
# Label Encoding(标签编码):文字 → 数字
from sklearn.preprocessing import LabelEncoder
le = LabelEncoder()
df['性别编码'] = le.fit_transform(df['性别']) # 按 Unicode 排序:女→0, 男→1
# One-Hot Encoding(独热编码):更安全的编码方式
# 城市: 北京/上海/广州 → [1,0,0] / [0,1,0] / [0,0,1]
df_encoded = pd.get_dummies(df, columns=['城市'], dtype=int)
# === 4. 特征选择 ===
# 不是所有特征都有用,有些特征可能噪声大于信号
# 相关性分析
corr = df.corr(numeric_only=True)
print(corr['房价'].sort_values(ascending=False))
# 选择相关性高的特征
# 房价与面积相关性 0.85 → 保留
# 房价与门牌号相关性 0.01 → 删除
# === 5. 特征创造 ===
# 从已有特征中创造新特征
df['房间密度'] = df['房间数'] / df['面积'] # 每平方米房间数
df['房龄分段'] = pd.cut(df['房龄'], bins=[0, 5, 10, 20, 100],
labels=['新房', '次新房', '旧房', '老房'])
df['是否学区'] = (df['学区'] == '是').astype(int)
💡 特征工程的黄金法则:
1. 理解业务:特征要有业务含义,不要盲目创造
2. 处理缺失:不能有空值,选择合适的填充策略
3. 缩放:KNN/SVM/神经网络必须缩放,树模型不需要
4. 编码:类别特征必须转为数字
5. 选择:保留有用的特征,删除无用的
6. 创造:从已有特征中提取更多信息
6. 训练集与测试集
# 核心原则:不能用训练数据评估模型效果!
# 类比:考试不能用练习题出卷,否则人人满分
# === 训练集/测试集划分 ===
from sklearn.model_selection import train_test_split
X = df[['面积', '楼层', '房龄', '地铁距离']] # 特征
y = df['房价'] # 标签
# 80% 训练,20% 测试
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42
)
print(f'训练集: {X_train.shape[0]} 条') # 800 条
print(f'测试集: {X_test.shape[0]} 条') # 200 条
# random_state=42 固定随机种子,保证每次划分结果相同
# 为什么要随机?避免数据有顺序偏差(如按时间排序,后面的全是新数据)
# === 交叉验证(更可靠的评估方式)===
# 把数据分成 K 份,每次用 1 份做测试、K-1 份做训练,重复 K 次
# 优点:充分利用所有数据,评估结果更稳定
from sklearn.model_selection import cross_val_score
from sklearn.linear_model import LinearRegression
model = LinearRegression()
# 5 折交叉验证
scores = cross_val_score(model, X, y, cv=5, scoring='r2')
print(f'5折交叉验证 R² 分数: {scores}')
print(f'平均 R²: {scores.mean():.4f} ± {scores.std():.4f}')
# 结果解读:
# 如果平均 R² = 0.85,标准差 = 0.03
# 说明模型效果稳定,R² 约在 0.82-0.88 之间
7. 模型评估指标
📋 回归指标(预测数值)
from sklearn.metrics import mean_squared_error, mean_absolute_error, r2_score
# y_test: 真实值
# y_pred: 预测值
# MSE(均方误差):越小越好
mse = mean_squared_error(y_test, y_pred)
# RMSE(均方根误差):和原始数据同单位,更直观
rmse = np.sqrt(mse)
# MAE(平均绝对误差):直观,不受极端值影响太大
mae = mean_absolute_error(y_test, y_pred)
# R²(决定系数):0-1,越接近 1 越好
# R² = 1 - 残差平方和 / 总平方和
# R² = 0.85 意味着模型解释了 85% 的数据变异
r2 = r2_score(y_test, y_pred)
print(f'MSE: {mse:.2f}')
print(f'RMSE: {rmse:.2f}')
print(f'MAE: {mae:.2f}')
print(f'R²: {r2:.4f}')
📋 分类指标(预测类别)
from sklearn.metrics import (
accuracy_score, precision_score, recall_score,
f1_score, confusion_matrix, classification_report
)
# y_test: 真实标签
# y_pred: 预测标签
# 准确率(Accuracy):预测正确的比例
# 100 个样本,95 个预测正确 → 准确率 95%
acc = accuracy_score(y_test, y_pred)
# 精确率(Precision):预测为正的样本中,真正为正的比例
# 预测 10 封是垃圾邮件,其中 8 封确实是 → 精确率 80%
prec = precision_score(y_test, y_pred)
# 召回率(Recall):真正为正的样本中,被正确预测的比例
# 实际有 20 封垃圾邮件,模型找到了 16 封 → 召回率 80%
rec = recall_score(y_test, y_pred)
# F1 分数:精确率和召回率的调和平均
f1 = f1_score(y_test, y_pred)
# 混淆矩阵
cm = confusion_matrix(y_test, y_pred)
print(cm)
# [[90 5] ← 真负:90, 伪正:5
# [ 3 102]] ← 伪负:3, 真正:102
# 完整报告
print(classification_report(y_test, y_pred))
💡 精确率 vs 召回率怎么选?
• 精确率优先:宁可漏掉,不能误判。如:垃圾邮件过滤(误判正常邮件很严重)
• 召回率优先:宁可误判,不能漏掉。如:癌症筛查(漏诊很危险)
• F1 分数:两者都重要时,用 F1 综合评估
8. Scikit-learn 快速入门
# Scikit-learn 是 Python 最流行的机器学习库
# 统一的 API:fit() 训练 → predict() 预测 → score() 评估
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score, classification_report
# 1. 加载数据
iris = load_iris()
X, y = iris.data, iris.target
# 2. 划分训练/测试集
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
# 3. 特征缩放
scaler = StandardScaler()
X_train = scaler.fit_transform(X_train) # 在训练集上 fit + transform
X_test = scaler.transform(X_test) # 在测试集上只 transform
# 4. 训练模型
model = LogisticRegression(max_iter=200)
model.fit(X_train, y_train)
# 5. 预测
y_pred = model.predict(X_test)
# 6. 评估
acc = accuracy_score(y_test, y_pred)
print(f'准确率: {acc:.4f}') # 通常在 0.97-1.0 之间(取决于 sklearn 版本)
print(classification_report(y_test, y_pred, target_names=iris.target_names))
# 7. 预测新数据
new_flower = [[5.1, 3.5, 1.4, 0.2]] # 一朵新花的特征
new_flower_scaled = scaler.transform(new_flower)
prediction = model.predict(new_flower_scaled)
print(f'预测品种: {iris.target_names[prediction[0]]}')
# === Scikit-learn 常用模型速查 ===
# 分类模型
from sklearn.linear_model import LogisticRegression # 逻辑回归
from sklearn.tree import DecisionTreeClassifier # 决策树
from sklearn.ensemble import RandomForestClassifier # 随机森林
from sklearn.svm import SVC # 支持向量机
from sklearn.neighbors import KNeighborsClassifier # K 近邻
from sklearn.naive_bayes import GaussianNB # 朴素贝叶斯
# 回归模型
from sklearn.linear_model import LinearRegression # 线性回归
from sklearn.tree import DecisionTreeRegressor # 决策树回归
from sklearn.ensemble import RandomForestRegressor # 随机森林回归
from sklearn.svm import SVR # SVM 回归
# 聚类模型
from sklearn.cluster import KMeans # K-Means
from sklearn.cluster import DBSCAN # DBSCAN
# 通用流程:
# model = ModelName(参数)
# model.fit(X_train, y_train) # 训练
# y_pred = model.predict(X_test) # 预测
# score = model.score(X_test, y_test) # 评估
9. 今日练习
🏋️ 练习 1:鸢尾花分类
# 用 Scikit-learn 完成鸢尾花分类:
# 1. 加载 iris 数据集
# 2. 划分训练集/测试集(80/20)
# 3. 训练 LogisticRegression
# 4. 输出准确率和分类报告
# 5. 预测新样本的品种
🏋️ 练习 2:模型对比
# 用同一个数据集,对比不同模型的效果:
# - LogisticRegression
# - DecisionTreeClassifier
# - RandomForestClassifier
# - KNeighborsClassifier
# 输出每个模型的准确率,找出最好的
🏋️ 练习 3:特征工程实践
# 对一个真实数据集:
# 1. 处理缺失值
# 2. 对类别特征进行编码
# 3. 对数值特征进行标准化
# 4. 对比特征工程前后的模型效果
10. 今日小结
| |
|---|
| 监督学习(分类/回归)· 无监督学习(聚类)· 强化学习 |
| 特征 / 标签 / 样本 / 模型 / 训练 / 预测 |
| 缺失值 / 缩放 / 编码 / 特征选择 / 特征创造 |
| train_test_split(80/20)· 交叉验证(K折) |
| |
| Accuracy / Precision / Recall / F1 / 混淆矩阵 |
| fit() → predict() → score() 统一 API |
🚀 明日预告:Day 86 — Scikit-learn 入门
线性回归、逻辑回归、模型评估——用 Scikit-learn 动手训练真实的机器学习模型。从理论走向实践!