Python Data Analysis: Master Python Analytics with Machine Learning, Deep Learning, GenAI, LLMs, and Data Engineering
内容简介
本书引领您超越常规的数据清洗与可视化,深入现代数据分析的核心——构建可扩展的数据管道,应用机器学习,处理文本与图像数据,并一窥生成式AI与大语言模型等前沿AI技术。依托Python蓬勃发展的数据生态,本书手把手教您攻克这些现实挑战。
不同于聚焦单一库或技术的著作,本书采用端到端的系统化视角,覆盖Python数据分析的完整流程。您将从数据准备、探索性分析起步,一路进阶至机器学习、自然语言处理、图像分析、规模化计算,直至AI驱动的工作流构建。
全书从统计学基础出发,系统讲解数据清洗、变换、整理与可视化技巧;随后深入时间序列分析、信号处理、预测建模,并实战应用回归、分类、聚类、主成分分析、概率方法与贝叶斯推断等机器学习技术。
书中还涵盖图分析、情感分析、自然语言处理、图像分析、生成式AI与大语言模型等前沿专题。最后,您将学会运用Dask、Modin、Ray和PySpark等框架,为分析工作流赋予大规模并行处理能力。
学完本书,您将具备构建端到端数据分析管道的完整能力,能够运用现代数据科学与AI技术,从容应对真实世界的复杂问题。
核心特色
借助Python、pandas及探索性数据分析技术,完成数据准备、清洗与变换
使用Python实现回归、分类、聚类、主成分分析及贝叶斯方法等机器学习应用
利用Dask、Ray、Modin和PySpark扩展分析工作流,实现规模化计算
你将学到什么
为探索性数据分析和数据整理,完成数据准备、清洗与变换
使用Python和pandas进行数据分析与可视化
执行时间序列分析、预测与信号处理
基于scikit-learn应用Python机器学习技术
运用回归、分类、聚类、主成分分析及贝叶斯方法
进行情感分析、自然语言处理、图分析与图像分析
借助Dask、Modin和Ray加速工作流
使用PySpark构建可扩展的大数据分析管道
适合读者
本书面向数据分析师、数据科学家、商业分析师、统计学家、在校学生及学术研究人员,尤其适合希望强化Python数据分析技能,并将数据科学方法应用于数据准备、可视化、机器学习、自然语言处理、图像分析及大数据处理等实际问题的读者。具备基础的数学知识和Python使用经验,将有助于您更充分地吸收书中内容。
目录
第1章 Python库入门
第2章 NumPy与Pandas
第3章 数据洞察统计学
第4章 线性代数
第5章 数据可视化
第6章 数据获取、处理与存储
第7章 清洗脏数据
第8章 时间序列分析
第9章 监督学习:回归与分类
第10章 无监督学习:降维、聚类与异常检测
第11章 集成方法:Bagging与Boosting
第12章 人工神经网络与深度学习
第13章 文本数据分析
第14章 图像数据分析
第15章 大语言模型与生成式AI
第16章 使用Dask、Modin和Ray进行并行计算
第17章 使用PySpark进行大数据分析