一、为什么学数据分析,一定会碰到画图
前面你已经学了 NumPy 和 Pandas。 它们很擅长处理数据、清洗数据、统计数据。 但如果数据只停留在表格里,很多信息其实并不好一眼看出来。
比如一组销售额数字放在表里,你当然能读。 可如果把它画成折线图,趋势立刻就出来了。 哪几个月上涨,哪几个月下跌,哪里突然异常,几乎一眼就能看见。
再比如一堆商品销量,如果只看表格,你得一行一行比。 如果画成柱状图,谁高谁低马上就明白了。
这就是可视化的价值。
数据分析不是只会算,还要会展示。 很多时候,一张图比十行统计结果更容易让人理解。 而在 Python 世界里,入门最经典、最常用的绘图库之一,就是 Matplotlib。
二、Matplotlib 到底是什么
Matplotlib 是 Python 里最常见的绘图库之一。 你可以把它理解成:
把数据变成图表的工具。
它能画很多图,比如:
折线图 柱状图 散点图 饼图 直方图 子图组合
虽然现在也有其他更现代、更高级的可视化库,但 Matplotlib 依然是非常重要的基础。 原因很简单:
它应用广 资料多 很多库都基于它或和它配合 你学会它之后,再学别的图形库会轻松很多
所以这章的重点,不是一下子把所有图都画全,而是先把“用 Python 把数据画出来”这件事真正跑通。
三、先安装 Matplotlib
如果你的环境里还没有安装,可以先装:
python -m pip install matplotlib
导入时最常见的写法是:
import matplotlib.pyplot as plt
这里的 pyplot 是 Matplotlib 里最常用的绘图接口,通常简写成 plt。 以后你几乎会反复看到这句:
import matplotlib.pyplot as plt
这就像 Pandas 常写成 pd,NumPy 常写成 np 一样,是约定俗成的写法。
四、先画第一张最简单的图
我们先不讲概念,直接看最小例子。
import matplotlib.pyplot as pltx = [1, 2, 3, 4, 5]y = [2, 4, 6, 8, 10]plt.plot(x, y)plt.show()
这段代码做了三件事:
第一,准备横轴数据 x第二,准备纵轴数据 y第三,用 plt.plot() 画图,再用 plt.show() 显示出来
plot() 是最基础的折线图函数。 你可以先把它理解成:
把一组横坐标和一组纵坐标连成线。
如果你把这段代码跑起来,就会看到一张简单的折线图。
这一步非常重要。 因为很多人学绘图时,一上来就被各种参数吓住。 其实最基础的思路一点都不复杂:
先有数据 再选图类型 最后显示出来
五、plt.show() 为什么几乎每次都出现
很多初学者看代码时,会注意到最后经常有一句:
plt.show()
它的作用很直接,就是把当前图真正显示出来。
你可以把前面的 plot()、bar()、scatter() 理解成“在画布上添加内容”。 而 show() 则像是最后说一句:
现在把图拿出来给我看。
如果没有这句,在很多普通脚本环境里,图可能不会弹出来。 所以入门阶段,一个很稳的习惯就是:
画完图,最后加一句 plt.show()
六、折线图:最适合看趋势
折线图是最常用的图之一。 只要你想看“随时间变化的趋势”,通常都可以先想到折线图。
比如看一周销量变化:
import matplotlib.pyplot as pltdays = ["周一", "周二", "周三", "周四", "周五", "周六", "周日"]sales = [120, 150, 130, 170, 160, 200, 180]plt.plot(days, sales)plt.show()
这张图最适合回答的问题是:
整体是在涨还是在跌 哪一天最高 哪一天最低 是否有明显波动
所以以后你看到按时间、按顺序排列的数据,比如:
日期 月份 年份 小时 周次
想分析趋势时,折线图通常是第一选择。
七、给图加标题和坐标轴名称
刚才的图能画出来,但还不够完整。 因为别人看到图时,可能不知道你在画什么。
所以一般会加:
标题 横轴名称 纵轴名称
比如:
import matplotlib.pyplot as pltdays = ["周一", "周二", "周三", "周四", "周五", "周六", "周日"]sales = [120, 150, 130, 170, 160, 200, 180]plt.plot(days, sales)plt.title("一周销量变化")plt.xlabel("日期")plt.ylabel("销量")plt.show()
这样图的表达就完整很多了。
标题告诉别人整张图在说什么。 横轴和纵轴标签告诉别人每个方向分别代表什么。
这个习惯非常重要。 因为真正能交流的图,不只是画出来,还要让人一眼读懂。
八、线条样式、颜色、标记点
Matplotlib 的一个特点是可调节项很多。 入门阶段你不用全部记,但有几个特别常用。
比如颜色:
plt.plot(days, sales, color="red")
线型:
plt.plot(days, sales, linestyle="--")
点的标记:
plt.plot(days, sales, marker="o")
合在一起:
import matplotlib.pyplot as pltdays = ["周一", "周二", "周三", "周四", "周五", "周六", "周日"]sales = [120, 150, 130, 170, 160, 200, 180]plt.plot(days, sales, color="red", linestyle="--", marker="o")plt.title("一周销量变化")plt.xlabel("日期")plt.ylabel("销量")plt.show()
这样图会更清楚,也更好看一点。
你可以先记住这三个最常用参数:
color 控制颜色linestyle 控制线型marker 控制点的形状
够用了,后面再慢慢扩展。
九、同一张图里画多条线
很多时候你不是只看一组数据,而是要做对比。
比如同一周里,苹果和香蕉的销量变化:
import matplotlib.pyplot as pltdays = ["周一", "周二", "周三", "周四", "周五", "周六", "周日"]apple_sales = [120, 150, 130, 170, 160, 200, 180]banana_sales = [90, 110, 105, 115, 130, 140, 150]plt.plot(days, apple_sales, marker="o", label="苹果")plt.plot(days, banana_sales, marker="s", label="香蕉")plt.title("一周水果销量对比")plt.xlabel("日期")plt.ylabel("销量")plt.legend()plt.show()
这里多了一个重要东西:
label="苹果"label="香蕉"plt.legend()
label 是给每条线起名字。legend() 是显示图例。
如果没有图例,两条线画出来,别人未必知道谁是谁。 所以多组数据同时出现时,图例几乎是必需的。
十、柱状图:最适合比较大小
如果你想强调的是“不同类别之间谁高谁低”,很多时候柱状图比折线图更合适。
比如比较三家门店销量:
import matplotlib.pyplot as pltstores = ["北京", "上海", "广州"]sales = [320, 410, 280]plt.bar(stores, sales)plt.title("各门店销量对比")plt.xlabel("门店")plt.ylabel("销量")plt.show()
这时候你最关注的不是趋势,而是类别之间的差异。 谁最高,谁最低,差距大不大。
柱状图特别适合这种“横向比较”。
常见场景有:
不同商品销量对比 不同门店销售额对比 不同班级平均分对比 不同月份订单数对比
只要横轴是类别,纵轴是数值,柱状图通常都很实用。
十一、柱状图也可以做并排对比
比如比较三家门店在两个月的销量:
import matplotlib.pyplot as pltimport numpy as npstores = ["北京", "上海", "广州"]sales_jan = [320, 410, 280]sales_feb = [300, 390, 350]x = np.arange(len(stores))width = 0.35plt.bar(x - width / 2, sales_jan, width=width, label="1月")plt.bar(x + width / 2, sales_feb, width=width, label="2月")plt.xticks(x, stores)plt.title("各门店两个月销量对比")plt.xlabel("门店")plt.ylabel("销量")plt.legend()plt.show()
这里你会第一次看到一点点“坐标控制”的味道。 不用急着死记,先理解结果就行:
为了让两组柱子不要重叠,需要给它们左右稍微错开位置。
这类并排柱状图在报表中非常常见。 因为它很适合做多组类别比较。
十二、散点图:最适合看两个变量之间的关系
如果你想知道:
学习时间和成绩有没有关系 广告投入和销售额有没有关系 身高和体重之间大概什么趋势
这类问题,散点图很适合。
比如:
import matplotlib.pyplot as pltstudy_hours = [1, 2, 3, 4, 5, 6, 7]scores = [50, 55, 65, 70, 75, 85, 90]plt.scatter(study_hours, scores)plt.title("学习时间与成绩关系")plt.xlabel("学习时间")plt.ylabel("成绩")plt.show()
散点图不会把点连成线,而是把每对数据画成一个独立点。 这样你更容易观察它们之间是否大致呈现某种关系。
比如:
学习时间越长,成绩是不是普遍更高 有没有明显离群点 数据分布密不密集
所以当你不是要看趋势线,而是要看“两个变量之间的关联感觉”,可以优先想到散点图。
十三、饼图:适合看占比,但别乱用
饼图常用来表示构成比例,比如:
不同商品销售额占比 不同部门预算占比 不同渠道订单占比
最基础的写法:
import matplotlib.pyplot as pltlabels = ["苹果", "香蕉", "橙子"]values = [40, 35, 25]plt.pie(values, labels=labels)plt.title("水果销售占比")plt.show()
如果想直接显示百分比:
import matplotlib.pyplot as pltlabels = ["苹果", "香蕉", "橙子"]values = [40, 35, 25]plt.pie(values, labels=labels, autopct="%1.1f%%")plt.title("水果销售占比")plt.show()
这里的 autopct 表示在图中显示百分比格式。
不过要提醒一句,饼图不是万能图。 类别太多时,饼图会变得很乱。 如果要精确比较多个类别差距,柱状图通常更清楚。
所以饼图适合的是:
类别不多 重点是看占比结构 不是做精细比较
十四、直方图:看数据分布特别好用
直方图和柱状图长得有点像,但用途不一样。
柱状图主要是比较类别。 直方图主要是看连续数值的分布。
比如一班学生成绩分布:
import matplotlib.pyplot as pltscores = [55, 60, 62, 67, 70, 72, 75, 78, 80, 82, 85, 88, 90, 92, 95]plt.hist(scores, bins=5)plt.title("学生成绩分布")plt.xlabel("成绩")plt.ylabel("人数")plt.show()
这里的 bins=5 表示把数据区间分成 5 组。
直方图特别适合看:
数据集中在哪一段 分布是否均匀 是偏高还是偏低 有没有明显异常
以后你做数据分析时,如果想先快速感受一列数值的分布,直方图非常值得先画一下。
十五、figure 是什么,为什么有时要先写 plt.figure()
很多教程会写:
plt.figure(figsize=(8, 4))
这句的作用,最直观地理解就是:
先创建一张图,并指定图的大小。
比如:
import matplotlib.pyplot as pltdays = ["周一", "周二", "周三", "周四", "周五", "周六", "周日"]sales = [120, 150, 130, 170, 160, 200, 180]plt.figure(figsize=(8, 4))plt.plot(days, sales, marker="o")plt.title("一周销量变化")plt.xlabel("日期")plt.ylabel("销量")plt.show()
这里 figsize=(8, 4) 表示宽 8、高 4。 单位你先不用纠结,记住它能控制图的整体尺寸就行。
什么时候需要它。
图太小 标签太挤 想让图更宽 想导出更适合展示的比例
这时都可以先加 plt.figure()。
十六、网格线能让图更容易读
很多图如果没有参照线,看数值不太方便。 这时可以加网格:
import matplotlib.pyplot as pltdays = ["周一", "周二", "周三", "周四", "周五", "周六", "周日"]sales = [120, 150, 130, 170, 160, 200, 180]plt.plot(days, sales, marker="o")plt.title("一周销量变化")plt.xlabel("日期")plt.ylabel("销量")plt.grid(True)plt.show()
grid(True) 就是打开网格。
它不是必须,但在很多统计图里非常实用。 尤其是当你想更方便地观察大致数值位置时,网格会让图更好读。
十七、中文显示乱码,是 Matplotlib 初学最常见的问题之一
这是非常现实的一个坑。
很多人明明代码没错,但图标题、坐标轴、图例里的中文显示成方块或乱码。 原因通常不是 Matplotlib 逻辑错了,而是当前环境没有正确配置中文字体。
常见的处理方式之一是:
import matplotlib.pyplot as pltplt.rcParams["font.sans-serif"] = ["SimHei"]plt.rcParams["axes.unicode_minus"] = False
然后再画图:
import matplotlib.pyplot as pltplt.rcParams["font.sans-serif"] = ["SimHei"]plt.rcParams["axes.unicode_minus"] = Falsedays = ["周一", "周二", "周三", "周四", "周五", "周六", "周日"]sales = [120, 150, 130, 170, 160, 200, 180]plt.plot(days, sales, marker="o")plt.title("一周销量变化")plt.xlabel("日期")plt.ylabel("销量")plt.show()
这里有两个点:
font.sans-serif 用来设置中文字体axes.unicode_minus = False 用来避免负号显示异常
不同电脑可用字体可能不一样。 有时 SimHei 可行,有时需要改成别的本机字体。 你现在先记住这个方向就够了:
中文乱码,多半先从字体设置排查。
十八、保存图片:不是只能看,还能导出
画图通常不是给自己看一眼就完了。 很多时候你还要发给别人,或者插进报告里。 这时就要保存。
最常用的是:
plt.savefig("chart.png")
比如:
import matplotlib.pyplot as pltdays = ["周一", "周二", "周三", "周四", "周五", "周六", "周日"]sales = [120, 150, 130, 170, 160, 200, 180]plt.plot(days, sales, marker="o")plt.title("一周销量变化")plt.xlabel("日期")plt.ylabel("销量")plt.savefig("sales_chart.png")plt.show()
这样当前目录下就会生成一张图片。
很多人会问,savefig() 和 show() 谁先谁后。 通常更稳妥的习惯是:
先 savefig()再 show()
因为在某些环境里,show() 之后图对象状态可能已经变化,导致保存结果不理想。
十九、subplots:一页里放多张图
现实里有时你想一次看多个图。 比如左边看销量,右边看销售额。 或者上面看折线,下面看柱状。
这时就会用到子图。
最简单例子:
import matplotlib.pyplot as pltmonths = ["1月", "2月", "3月", "4月"]sales = [500, 650, 620, 700]profit = [120, 160, 150, 180]plt.figure(figsize=(10, 4))plt.subplot(1, 2, 1)plt.plot(months, sales, marker="o")plt.title("销售额")plt.subplot(1, 2, 2)plt.bar(months, profit)plt.title("利润")plt.tight_layout()plt.show()
这里:
subplot(1, 2, 1)表示把画布分成 1 行 2 列,现在画第 1 个位置
subplot(1, 2, 2)表示画第 2 个位置
tight_layout()表示自动调整布局,尽量避免标题和标签互相挤压
子图是非常实用的能力,因为真实分析里,一张图往往不足以完整表达问题。
二十、Matplotlib 和 Pandas 经常一起用
这点特别重要。
现实里你往往不是手写数据,而是先用 Pandas 读进来,再画图。
比如:
import pandas as pdimport matplotlib.pyplot as pltdf = pd.DataFrame({"月份": ["1月", "2月", "3月", "4月"],"销售额": [500, 650, 620, 700]})plt.plot(df["月份"], df["销售额"], marker="o")plt.title("月销售额趋势")plt.xlabel("月份")plt.ylabel("销售额")plt.show()
你会发现,这条链路非常自然:
Pandas 管数据 Matplotlib 负责展示
这也是为什么学数据分析时,这两个库几乎总是连着出现。
二十一、一个更贴近实战的小案例:销售数据可视化
假设你已经有一份销售表,想快速做三件事:
看月销售额趋势 比较不同商品销量 看销售额构成
代码可以这样组织:
import pandas as pdimport matplotlib.pyplot as pltplt.rcParams["font.sans-serif"] = ["SimHei"]plt.rcParams["axes.unicode_minus"] = Falsedf = pd.DataFrame({"月份": ["1月", "2月", "3月", "4月"],"苹果销量": [120, 150, 130, 160],"香蕉销量": [90, 110, 105, 115],"销售额": [800, 980, 910, 1050]})plt.figure(figsize=(12, 4))plt.subplot(1, 3, 1)plt.plot(df["月份"], df["销售额"], marker="o")plt.title("月销售额趋势")plt.xlabel("月份")plt.ylabel("销售额")plt.subplot(1, 3, 2)plt.bar(["苹果", "香蕉"], [df["苹果销量"].sum(), df["香蕉销量"].sum()])plt.title("商品总销量对比")plt.subplot(1, 3, 3)plt.pie( [df["苹果销量"].sum(), df["香蕉销量"].sum()], labels=["苹果", "香蕉"], autopct="%1.1f%%")plt.title("销量占比")plt.tight_layout()plt.show()
这段代码并不复杂,但已经很像实际小分析了。 它说明一件事:
Matplotlib 真正的价值,不是只会画单张示例图,而是能把一份数据整理成更直观的展示结果。
二十二、初学 Matplotlib 最容易踩的几个坑
1. 画出来了,但没有标题和坐标轴说明
这样图虽然存在,但表达力很弱。 别人不一定看得懂。
2. 中文乱码
通常先检查字体设置,不要一看到方块就怀疑逻辑错了。
3. 想比较类别,却还硬用折线图
图能画,不代表图选得合适。 趋势用折线,对比用柱状,关系看散点,这个直觉要慢慢建立。
4. 不会区分柱状图和直方图
柱状图主要看类别对比。 直方图主要看连续数值分布。
5. 图很多,但没有图例
多条线、多组数据没有图例,别人根本不知道谁是谁。
6. 图挤在一起
这时要想到 figure(figsize=...) 和 tight_layout()。
7. 只会照着画,不知道为什么选这种图
这其实是最关键的问题。 画图不是炫技,而是选择最适合表达数据关系的方式。
二十三、这一章学到什么程度算入门
入门阶段,不要求你一下子会所有参数。 只要你能掌握下面这些,就已经非常不错了:
会安装并导入 Matplotlib 会用 plot() 画折线图 会用 bar() 画柱状图 会用 scatter() 画散点图 知道 pie() 和 hist() 的基本用途 会加标题、坐标轴名称、图例 会设置简单样式 会保存图片 知道如何处理中文显示问题 知道 Matplotlib 常和 Pandas 配合使用
做到这一步,后面你就已经能把很多分析结果从表格变成图了。
二十四、本章要点整理
Matplotlib 是 Python 里最常用的绘图库之一,适合把数据变成图表。 折线图适合看趋势,柱状图适合比较类别大小,散点图适合看两个变量之间的关系。 饼图适合看占比,直方图适合看连续数值的分布。plt.show() 用来显示图形,plt.savefig() 用来保存图片。 常见增强信息的做法包括加标题、坐标轴名称、图例和网格线。figure(figsize=...) 可以调图的大小,tight_layout() 可以优化布局。 中文乱码通常和字体配置有关,常见解决思路是设置中文字体和负号显示。 Matplotlib 经常和 Pandas 一起使用,前者负责展示,后者负责处理数据。 学绘图时,最重要的不是记住所有参数,而是知道什么数据该用什么图来表达。