当前位置:首页>python>Python-10-特征工程

Python-10-特征工程

  • 2026-10-11 08:11:52
Python-10-特征工程
特征工程,是一个处理特征的过程。在机器学习/建模里,特征本质是一组数据。特征=字段=列=指标,也可以理解为一件事情的一个角度。按是否可以进行数值型特征、分类型特征。

特征,包括了一件事物描述里可被收集的全部特征。比如人的身高、体重、姓名、年龄、收入、工作等。
这些特征初步收集起来用以分析时,我们称这些特征为“原始特征”。
然后我们用原始特征可以身高和体重推测出一个人是否肥胖,这种基原始特征计算出来的特征,称为“衍生特征”。这个常用在Excle的增加列(客单价=销售额/客户数,总收入=销量*单价)。
原始特征和衍生特征,我们可以直观看出来其意义。对于字段(特征),机器是看不懂中文的,它只能处理0/1组成的数值。为了让机器更懂我们的数据,我们需要对原始特征进行改造,这是真正意义上的特征工程(高端局)。

我们需要做什么?分别是两类特征的处理。
数值型特征:
机器学习中,基于距离、梯度、线性加权类的模型,比如线性回归、K菌类、神经网络、PCA主成分分析等,受极端值影响大,所以数据需要先进行归一化/标准化
而基于树模型、概率分布、排序的模型,对异常值不敏感,则无需要回归一化/标准化数据。主要取决于模型的特性。
还有一种情况是将连续的数值,进行分箱。
分类型特征:
需要将这类非数值的特征进行编码,转化称称机器能懂的数字。这个方法有标签编码、独热编码、目标表嘛等。

后期:
特征工程构造完毕后,输入模型后,评估模型的性能,然后进行优化。优化的过程中要找出一些重要的特征值,剔除不必要的特征,这有利于后期维护,减少数据采集的成本,降低模型的训练时间。
从业务角度来说,找到影响结果的重要特征,有助于业务落地。

总结:
特征工程是将原始数据进行处理成机器能读懂的语言,然后再找到影响结果的重要特征,提升模型性能。

Day 10
#Python学习,#特征go工程,#数据建模
文字本身就是理性思考后的产物,它永远无法代替直观的感受。

最新文章

随机文章