当前位置:首页>python>10步Python图解PCA,零基础也能跟着从头跑通

10步Python图解PCA,零基础也能跟着从头跑通

  • 2026-09-08 17:40:16
10步Python图解PCA,零基础也能跟着从头跑通

主成分分析(PCA)是提高机器学习算法处理大量数据和特征性能的最常用方法之一。然而,PCA 有时可能太复杂、太技术化,甚至太乏味,难以正确理解基本原理。

这篇文章将以实际的方式阐明每一步,易于初学者理解。

为什么需要在机器学习中使用 PCA

PCA 的四大价值

去除噪声数据:数据集中有太多数据需要分析时,PCA 会过滤掉噪声数据,只留下突出的数据

提高性能:通过去除大量不相关的特征,大幅减少机器学习的训练时间

简化可视化:去掉没有影响的特征后,数据可视化更清晰,更易于理解

减少过拟合:许多过拟合仅仅是因为特征太多,PCA 有助于缓解这一问题

1数据加载与查看

本文通过 Kaggle 数据集实现 PCA(数据集来源:hr-dataset)。通过 pandas 的 head 函数,我们可以看到数据集的特征和数据如下:

原始数据集,包含 10 个特征
2数据清理

如我们所见,原始数据集由 10 个特征组成,还有一些离散数据。机器学习算法不能消化离散数据,我们需要将它们转换为有序数据。

对于 PCA,需要将销售(sales)和薪资(salary)特征转换为有序数据,如下所示:

Python
# 将离散数据映射为有序数据data['salary'] = data['salary'].map({    'low': 1,    'medium': 2,    'high': 3}).astype(int)  data['sales'] = data['sales'].map({    'accounting': 1, 'hr': 2, 'IT': 3,    'management': 4, 'marketing': 5, 'product_mng': 6,    'RandD': 7, 'sales': 8, 'support': 9, 'technical': 10}).astype(int)

这将为我们提供一个没有任何离散数据的新数据集:

转换后的数据集,离散数据已变为有序数值

如我们所见,left 特征是一个标签,因此可以更方便地将其设置在数据列的最左侧,以便进行数据拆分。首先将特征转换为列表以重新排列列:

Python
# 获取列名列表columns = data.columns.tolist()# 将 left 特征移到第一列columns.insert(0, columns.pop(columns.index('left')))# 重新排列列顺序data = data.reindex(columns=columns)
重排后的数据集,left 标签已置于首列
3相关性矩阵

随后,我们可以通过相关性矩阵分析每个特征之间的相关性,相关矩阵可以通过 seaborn 库构建:

Python
correlation = data.corr()  plt.figure(figsize=(10, 10)) sns.heatmap(correlation, vmax=1, square=True,             annot=True, cmap='viridis') plt.title('Correlation between features')
特征间相关性矩阵热力图
4数据划分

由于 left 特征是一个标签,我们可以对数据集随机化,然后将数据拆分为 X 和 Y,X 为训练数据,y 为标签数据:

Python
# X 为训练数据(第2~10列),y 为标签数据(第1列)X = data.iloc[:, 1:10].values y = data.iloc[:, 0].values
X 训练数据
现在我们有 9 个训练数据的特征
5数据标准化

现在进入了 PCA 的第一步——数据标准化,这是执行 PCA 之前的必要步骤。数据标准化的目的是通过使用平均值和标准差来均衡所有数据。

通俗类比

1-A 班的安迪在数学考试中得了 80 分(满分 100,标准差 6 分),1-B 班的海伦得了 320 分(满分 450,标准差 68 分)。为了比较谁的分数更高,我们用百分比来标准化:安迪得到 80%,海伦得到 71%,因此安迪的分数比海伦高。

在 Python 中,我们可以使用 sklearn 的 StandardScaler 函数对数据进行标准化:

Python
from sklearn.preprocessing import StandardScaler  X_std = StandardScaler().fit_transform(X)

Sklearn 的 StandardScaler 的原理是用平均值减去值,再除以标准差:

其中 z 为标准化数据,x 为原始数据,μ 为平均值,σ 为标准差。

平均值公式:

标准差公式:

现在数据集已经通过使用 sklearn 函数实现了标准化,输出如下:

标准化后的数据输出
6协方差矩阵

在标准化之后,我们想再次找出每个特征之间的相关性。这可以通过使用以下公式来实现:

或者用如下 Python 代码:

Python · 手动计算
mean_vec = np.mean(X_std) cov_mat = (X_std - mean_vec).T.dot((X_std - mean_vec)) / (X_std.shape[0] - 1)print('Covariance matrix', cov_mat)

或者简单地使用 Numpy 的协方差函数:

Python · NumPy 内置函数
print('NumPy covariance matrix:', np.cov(X_std.T))

两个代码将提供相同的输出:

协方差矩阵输出
NumPy 协方差函数输出(结果一致)
7求特征向量和特征值

既然我们通过协方差矩阵了解了每个特征之间的关系,就可以通过计算特征向量和特征值来确定主成分。

协方差矩阵被视为 A,可以使用 Numpy 函数来确定特征向量和特征值:

Python
eig_vals, eig_vecs = np.linalg.eig(cov_mat)print('Eigenvectors', eig_vecs)print('\nEigenvalues', eig_vals)
特征向量与特征值输出
8特征值排序

既然已经找到了特征值和特征向量,我们需要对特征值进行排序,以确定哪个特征向量在数据集中最相关。

首先,将每个特征值和特征向量组合成特征对:

Python
# 组合特征值和特征向量为特征对eig_pairs = [(np.abs(eig_vals[i]), eig_vecs[:, i])             for i inrange(len(eig_vals))]# 从高到低排序eig_pairs.sort(key=lambda x: x[0], reverse=True)

我们可以得到如下所示的有序特征值:

Python
print('Sorted Eigenvalues:')for i in eig_pairs:    print(i[0])
排序后的特征值列表
9确定主成分

现在我们可以从排序后的特征值中得到主成分。主成分的值即所谓的解释方差,表明一个特征的突出程度。我们目前有 9 个不同的主成分,因此将产生 9 个不同的百分比方差。

Python
# 计算解释方差百分比tot = sum(eig_vals) var_exp = [(i / tot) * 100for i insorted(eig_vals, reverse=True)]

然后使用 Matplotlib 绘制每个主成分的值:

Python
with plt.style.context('bmh'):     plt.figure(figsize=(6, 4))     plt.bar(range(9), var_exp, alpha=0.5, align='center')     plt.ylabel('Explained Variance')     plt.xlabel('Principal components')     plt.tight_layout()
各主成分的解释方差
关键发现

最大方差在 20.5% 左右。最后两个特征与其他特征相比影响比较小,因为它们的方差小于 7.5%。因此,我们可以放弃这两个特征。

10构造新矩阵

既然决定去掉最后两个特征,我们就可以构造只包含前 7 个特征的新矩阵:

Python
# 用前7个特征向量构造PCA矩阵PCA_matrix = np.hstack((     eig_pairs[0][1].reshape(9, 1),     eig_pairs[1][1].reshape(9, 1),     eig_pairs[2][1].reshape(9, 1),     eig_pairs[3][1].reshape(9, 1),     eig_pairs[4][1].reshape(9, 1),     eig_pairs[5][1].reshape(9, 1),     eig_pairs[6][1].reshape(9, 1), ))

然后利用点积法,利用 Y = XW 建立新的特征空间:

Python
Y = X_std.dot(PCA_matrix)

然后创建一个新的数据集,包含每个主成分的数据和标签:

Python
principalDf = pd.DataFrame(     data=Y,     columns=['principal component 1', 'principal component 2',             'principal component 3', 'principal component 4',             'principal component 5', 'principal component 6',             'principal component 7'] )  finalDf = pd.concat([principalDf,                      pd.DataFrame(y, columns=['left'])],                     axis=1)

这将为我们提供一个新的数据集,该数据集已通过 PCA 处理:

PCA 处理后的新数据集(7 个主成分 + 标签)
新数据集完整视图
◆◆◆

结论

总结

关于放弃多少特征,我们有很多选择——放弃 2 个、3 个,甚至只留下 2 个特征。至少第一个特征是最突出的一个。

通过机器学习算法(如线性回归、随机森林等),处理这类降维后数据的速度要比处理整个数据集快得多。

PCA 全流程回顾:

① 数据标准化 → ② 计算协方差矩阵 → ③ 求特征值与特征向量 → ④ 排序选取主成分 → ⑤ 构造新特征空间

— END —

海豚实验室成功落地案例:

  • ...

海豚实验室重磅新闻:

版权声明


转自人工智能遇见磐创,版权属于原作者,仅用于学术分享

与此同时,杭州睿数科技(海豚实验室)同步推出了“百校千课免费支持”计划,全力为推进全国高校大数据与人工智能教学发展贡献力量,欢迎老师们致电咨询️☎️。

扫描申请后24小时内将有专员联系开通

【海豚人工智能与大数据实验室】是“一站式”大数据分析及人工智能的教育实训+科研平台,  由北美海归团队创立的杭州睿数科技有限公司自主研发。通过“沉浸式” “交互式”的在线虚拟实验平台,结合丰富的真实行业案例和数据集,切实解决大数据及人工智能教育培训环节的痛点。通过我们的整体解决方案,实现 “大数据 + X”,“人工智能 + X”的跨专业、跨学科复合型人才培养。全面助力中国人工智能,大数据产业的快速发展!

欢迎全国高校、培训机构、渠道合作伙伴与我们联系,开展合作!

请访问官网 www.dilabs.cn 在线客服,提供7x24全天候咨询服务

或联系邮箱 support@dilabs.ai 

或联系热线 400-001-3538

最新文章

随机文章