系列说明:本系列共 4 篇,本文是第 1 篇。
系列目录:
- 第 1 篇(本篇):NumPy 入门第一课——为什么数据科学离不开它
- 第 2 篇:NumPy 数组创建与操作大全——zeros、arange、reshape 一次讲清
- 第 3 篇:NumPy 索引切片与条件筛选——从数组中精确取数
- 第 4 篇:NumPy 实战收官——聚合、随机数、保存读取与绘图
这篇文章适合谁?
如果你满足下面任意一条,本文就是为你准备的:
- 刚学完 Python 基础语法(变量、列表、循环),准备踏入数据科学的大门;
- 看机器学习教程时,满屏都是
np.array、np.reshape、np.xxx,完全看不懂; - 听说过 NumPy 很牛,但不知道它到底解决什么问题,也不知道从哪开始学。
这一篇的目标很朴素:让你搞懂 NumPy 是什么、它解决什么问题、数组长什么样,并且能亲手写出自己的第一个 NumPy 程序。全程零基础友好,每段代码都建议你打开 Python 环境跟着敲一遍。
1. 为什么学数据科学,第一个要碰的就是 NumPy?
先看一张"食物链":
NumPy(数组运算)→ Pandas(表格处理)→ Matplotlib(绘图)→ Scikit-learn(机器学习)
NumPy 是整个 Python 数据科学生态系统的地基。Pandas 底层用 NumPy 数组存数据,Matplotlib 画图的数据要转成 NumPy 数组,机器学习模型的特征矩阵本质上也是 NumPy 数组。
所以一句话:NumPy 学不扎实,后面全都会卡壳。反过来,只要把 NumPy 这关过了,学 Pandas、Matplotlib 会顺滑很多。
2. NumPy 到底是什么?
NumPy 是Numerical Python的缩写,是一个开源的 Python 库,专门用于科学计算和工程领域。
它核心做两件事:
- 提供了一种高性能的数据结构——N 维数组(ndarray);
- 提供了大量用于高效处理这些数组的函数(求和、排序、统计、矩阵运算等)。
安装方式(如果你还没装):
安装完成后,在代码里按通用约定导入:
看到 np. 前缀,你就知道这是在调用 NumPy 的功能。这个约定全网通用,后面所有教程都会这么写。
新手提示:如果用的是 Anaconda,NumPy 通常已经预装好了,直接 import numpy as np 试试,不报错就说明环境 OK。
3. 什么是"数组"(ndarray)?——从直觉开始
很多教程一上来就甩定义,新手直接劝退。我们从生活直觉出发。
3.1 一维数组:像一条队列
想象你手上有 4 个数字:1, 5, 2, 0。把它们排成一排,就是一个一维数组:
对应到 Python 里,它最像你熟悉的列表。事实上,你可以用列表直接创建数组:
import numpy as npa = np.array([1, 5, 2, 0])print(a)
输出:
3.2 二维数组:像一张表格
如果数据有两行三列,就是一个二维数组:
| 1 | 5 | 2 || 8 | 3 | 6 |
创建方式是把"列表的列表"传给 np.array:
b = np.array([[1, 5, 2], [8, 3, 6]])print(b)
输出:
3.3 三维数组:像一叠表格
把两张同样的表格叠起来,就是三维数组——可以理解为一本书的多个页面,每页是一张表:
c = np.array([ [[1, 2], [3, 4]], [[5, 6], [7, 8]], [[9, 10], [11, 12]],])print(c)
输出:
[[[ 1 2] [ 3 4]] [[ 5 6] [ 7 8]] [[ 9 10] [11 12]]]
这个数组有 3 个"页面",每页 2 行 2 列。
3.4 关键结论
- NumPy 的
ndarray 就是 N 维数组(N-dimensional array),N 可以是 0、1、2、3……任意整数; - 一维像队列,二维像表格,三维像一叠表格,更高维可以以此类推;
4. 为什么 Python 列表不如 NumPy 数组?
这是新手最爱问的问题:"列表也能存数字、也能索引,为什么非要 NumPy?"
我们分三个方面讲清楚。
4.1 速度:快得多
Python 列表的每个元素都是独立的 Python 对象,操作时要经历大量解释器的开销。而 NumPy 数组把数据连续地存在内存里,运算是在底层用编译好的 C 语言批量执行。
直观体验:计算 100 万个数的总和。
import numpy as npimport time# 用 Python 列表lst = list(range(1_000_000))t0 = time.time()s1 = sum(lst)t1 = time.time()# 用 NumPy 数组arr = np.arange(1_000_000)t2 = time.time()s2 = arr.sum()t3 = time.time()print(f”列表求和耗时: {t1 - t0:.4f} 秒”)print(f”NumPy 求和耗时: {t3 - t2:.4f} 秒”)
输出(具体数值因电脑而异,但差距是数量级的):
列表求和耗时: 0.0320 秒NumPy 求和耗时: 0.0008 秒
在百万级数据上,NumPy 往往比纯 Python 列表快几十到上百倍。数据量越大,差距越明显。
4.2 内存:省得多
列表里每个元素都是独立对象,自带类型信息、引用计数等额外开销;而 NumPy 数组把所有元素紧凑连续地存放在一块内存里,只记录一次类型信息。
举例:同样存 100 万个整数,NumPy 数组占用的内存通常是列表的1/3 到 1/5。数据量上亿时,这个差距直接决定程序会不会内存爆炸。
4.3 语法:简洁得多
处理"把每个元素乘以 2"这种需求:
# Python 列表:要写循环lst = [1, 2, 3, 4]doubled = [x * 2 for x in lst]# NumPy 数组:直接乘arr = np.array([1, 2, 3, 4])doubled = arr * 2
再看"把两个数组对应元素相加":
# Python 列表a = [1, 2, 3]b = [10, 20, 30]c = [x + y for x, y in zip(a, b)]# NumPy:一行搞定c = np.array(a) + np.array(b)
NumPy 的向量化写法让代码更接近数学公式本身:公式长什么样,代码就长什么样。这就是为什么数据科学家几乎不用纯列表做数值运算。
小结:列表灵活通用,适合小规模、异构数据;NumPy 数组专为"大量同类型数值"而生——更快、更省、更简洁。
5. 数组的三个特点(限制)
NumPy 数组之所以快,是因为它接受了一些"限制",把自由度换成了性能:
特点一:同质(所有元素类型相同)
数组里所有元素必须是同一数据类型(比如全是整数,或全是浮点数)。不能用 [1, "小明", 3.5] 这样混着存的数组。
a = np.array([1, 2, 3])# 全是整数,OKb = np.array([1.0, 2.0, 3.0])# 全是浮点数,OK# c = np.array([1, ”小明”, 3.5])# 报错或自动转换,不推荐
好处是:每个元素占用固定大小,可以紧凑存储、快速寻址。
特点二:大小固定(创建后不能改总大小)
数组创建后,元素总数不能变。你不能像列表那样 append 或 remove。
想增删元素怎么办?答案是创建一个新数组。这看似麻烦,却让 NumPy 能提前规划内存布局,换来极致速度。
特点三:形状矩形(不能参差不齐)
二维数组的每一行,列数必须相同。比如 [[1,2,3],[4,5,6]] 合法(两行都是 3 列),而 [[1,2],[3,4,5]] 就不是一个合法的 NumPy 数组(第一行 2 列、第二行 3 列,参差不齐)。
这三条限制让 NumPy 可以"算准每一个元素的位置",从而在底层做高效的批量运算。记住:性能来自限制。
6. 动手:创建数组、索引、切片
6.1 索引(从 0 开始)
Python 和 NumPy 都采用0 索引:第一个元素下标是 0,不是 1。
a = np.array([10, 20, 30, 40, 50])print(a[0])# 第一个元素 → 10print(a[2])# 第三个元素 → 30print(a[-1])# 最后一个元素 → 50
输出:
6.2 可变性(能改值)
数组和列表一样是可变的,直接按索引赋值即可:
输出:
6.3 切片(取一段)
切片语法 起始:结束,包含起始、不包含结束(左闭右开):
print(a[1:4])# 下标 1 到 3 → [20 30 40]print(a[:3])# 前 3 个 → [99 20 30]print(a[2:])# 从下标 2 到最后 → [30 40 50]
输出:
[20 30 40][99 20 30][30 40 50]
新手必知的坑(重要):对 NumPy 数组切片,得到的是原数组的视图(view),修改切片会连带修改原数组;而 Python 列表切片得到的是新列表。这一块在系列第 2 篇会重点展开,先记住"切片可能改到原数据"即可。
7. 轴(axis)是什么?——axis=0 / axis=1 直观理解
"轴"是新手绕不开、也最容易晕的概念。先建立直觉:
- axis=0:沿行方向,也就是"从上往下"的方向;
- axis=1:沿列方向,也就是"从左往右"的方向。
用一个 3 行 2 列的数组举例:
data = np.array([[1, 2], [3, 4], [5, 6]])
沿 axis=0 求和(从上往下加,得到每列的和):
输出:
解读:第 1 列 1+3+5=9,第 2 列 2+4+6=12。
沿 axis=1 求和(从左往右加,得到每行的和):
输出:
解读:第 1 行 1+2=3,第 2 行 3+4=7,第 3 行 5+6=11。
记忆口诀:axis=0 的结果"长度等于列数"(每列一个结果),axis=1 的结果"长度等于行数"(每行一个结果)。做聚合操作前,先想清楚你要"按行聚合"还是"按列聚合",方向选对了,代码就对了。
8. 数组属性速查:ndim / shape / size / dtype
每个数组都自带"体检报告",四个最常用属性:
实操:
arr = np.array([[1, 2, 3, 4], [5, 6, 7, 8], [9, 10, 11, 12]])print(”维度数 ndim:”, arr.ndim)print(”形状 shape:”, arr.shape)print(”元素总数 size:”, arr.size)print(”数据类型 dtype:”, arr.dtype)
输出:
维度数 ndim: 2形状 shape: (3, 4)元素总数 size: 12数据类型 dtype: int64
要点:
shape 是一个元组,从左到右分别表示"第 0 轴长度、第 1 轴长度……",二维数组就是"行数、列数";size 永远等于 shape 各元素相乘:3 × 4 = 12;dtype 常见的值有 int64(64 位整数)、float64(64 位浮点数)等,创建数组时可以用 dtype 参数指定。
9. 实战彩蛋:一学期成绩表(shape 与 axis 的实战)
纸上得来终觉浅。我们用一个真实的场景把上面所有概念串起来。
场景:你是一所中学的班主任,班里 5 名同学,期末考了语文、数学、英语三科。你想快速回答三个问题:
代码:
import numpy as np# 5 行 3 列:行 = 学生,列 = [语文, 数学, 英语]scores = np.array([ [88, 92, 79], [65, 58, 70], [93, 87, 95], [76, 64, 82], [81, 73, 68],])# 1. 查看形状与大小print(”维度数:”, scores.ndim)# 2print(”形状:”, scores.shape)# (5, 3)print(”成绩总数:”, scores.size)# 15print(”数据类型:”, scores.dtype)# int64# 2. 每位同学的总分:沿列方向求和(axis=1 → 每行一个结果)total_per_student = scores.sum(axis=1)print(”每位同学总分:”, total_per_student)# 3. 每门课的平均分:沿行方向求均值(axis=0 → 每列一个结果)avg_per_subject = scores.mean(axis=0)print(”各科平均分:”, avg_per_subject)
输出:
维度数: 2形状: (5, 3)成绩总数: 15数据类型: int64每位同学总分: [259 193 275 222 222]各科平均分: [80.6 74.8 78.8]
解读:
- shape = (5, 3):5 行代表 5 位同学,3 列代表 3 门课。看到这个元组,你就能立刻说出数据组织的逻辑——这正是 shape 的意义:它告诉你怎么"读"这张表。
- size = 15:5 × 3 = 15,正好是成绩总数,和 shape 的乘积对上了。
scores.sum(axis=1):axis=1 沿列方向加,得到 5 个值,即每位同学的三科总分(第 2 位同学 58 分的数学把总分拉低了,一眼可见);scores.mean(axis=0):axis=0 沿行方向求平均,得到 3 个值,即每门课的平均分——数学 74.8 是全班最弱科,后续可以针对性补课。
这个例子虽然小,但已经完整演示了数据科学中最常见的操作模式:用 shape 理解数据结构 → 用 axis 控制聚合方向 → 用一行代码得到统计结果。
自己动手:试着把 axis=0 和 axis=1 换过来运行,看看输出变成了什么,并想想为什么。想通了,axis 就再也难不倒你了。
10. 总结与预告
本篇你学会了什么?
- NumPy 是 Python 数据科学的地基,提供了 N 维数组(ndarray)与高效运算函数;
- 相比 Python 列表,NumPy 在速度、内存、语法三方面全面胜出;
- 数组的三个特点:同质、大小固定、形状矩形——限制换来性能;
- 数组支持 0 索引、可变、切片,但切片返回的是视图;
- axis=0 沿行方向、axis=1 沿列方向,聚合结果长度分别为列数与行数;
- 四个核心属性:
ndim(维度数)、shape(形状)、size(元素总数)、dtype(数据类型)。
下一篇预告
第 2 篇《NumPy 数组创建与操作大全:zeros、arange、reshape 一次讲清》将带你掌握:
- 用
np.zeros / np.ones / np.arange / np.linspace 快速生成数组; - 用
reshape / newaxis / flatten 自由改变数组形状; - 用
concatenate / vstack / hstack 拼接数组;
学会了这些,你就具备独立处理真实数据的动手能力了。
如果这篇文章对你有帮助,请点赞 + 收藏 + 关注,这是对创作者最大的支持。下一篇见!
有任何问题欢迎在评论区留言,我会逐一回复。系列 4 篇持续更新中,关注后不会迷路。