当前位置:首页>python>Python 零基础100天—Day71 NumPy 基础

Python 零基础100天—Day71 NumPy 基础

  • 2026-10-11 06:48:06
Python 零基础100天—Day71 NumPy 基础

NumPy 基础 — 数据科学的基石

🕐 预计用时:2-3 小时 | 🎯 目标:掌握 ndarray、向量化运算、广播机制和数组索引切片


📖 今日目录

  1. NumPy 是什么?
  2. ndarray 数组
  3. 创建数组
  4. 数组属性
  5. 索引与切片
  6. 向量化运算
  7. 广播机制
  8. 常用函数
  9. 今日练习
  10. 今日小结

1. NumPy 是什么?

NumPy(Numerical Python) 是 Python 数据科学的基础库。它提供了一个强大的多维数组对象 ndarray,以及大量用于数组运算的数学函数。

# 为什么需要 NumPy?
# Python 列表:慢,占内存,功能少
# NumPy 数组:快,省内存,功能强大

# 性能对比
import time
import numpy as np

# Python 列表:两个各含 100 万个元素的列表相加
a = list(range(1_000_000))
b = list(range(1_000_000))
start = time.time()
c = [x + y for x, y in zip(a, b)]
print(f'Python 列表: {time.time()-start:.4f}秒')  # 约 0.15 秒

# NumPy 数组:两个各含 100 万个元素的数组相加
a = np.arange(1_000_000)
b = np.arange(1_000_000)
start = time.time()
c = a + b
print(f'NumPy 数组: {time.time()-start:.4f}秒')   # 约 0.003 秒
# NumPy 快 50 倍!

💡 NumPy 的核心优势:

• 速度快:底层 C 语言实现,比纯 Python 快 10-100 倍
• 省内存:连续存储,比 Python 列表节省 3-4 倍内存
• 向量化:不用写 for 循环,直接对整个数组运算
• 生态核心:Pandas、Matplotlib、Scikit-learn 都基于 NumPy


2. ndarray 数组

import numpy as np

# 从 Python 列表创建
arr1d = np.array([1, 2, 3, 4, 5])
print(arr1d)        # [1 2 3 4 5]
print(type(arr1d))  # <class 'numpy.ndarray'>

# 二维数组(矩阵)
arr2d = np.array([[1, 2, 3],
                  [4, 5, 6],
                  [7, 8, 9]])
print(arr2d)
# [[1 2 3]
#  [4 5 6]
#  [7 8 9]]

# 三维数组
arr3d = np.array([[[1, 2], [3, 4]],
                  [[5, 6], [7, 8]]])
print(arr3d.shape)  # (2, 2, 2)

# 指定数据类型
arr_float = np.array([1, 2, 3], dtype=np.float64)
arr_int = np.array([1.5, 2.7, 3.1], dtype=np.int32)  # 截断:[1 2 3]
dtype
说明
示例
np.int32
32位整数
np.array([1,2], dtype=np.int32)
np.int64
64位整数(NumPy 2.0+ 默认)
np.array([1,2])
np.float32
32位浮点数
np.array([1.0,2.0], dtype=np.float32)
np.float64
64位浮点数(默认)
np.array([1.0,2.0])
np.bool_
布尔
np.array([True, False])
np.str_
字符串
np.array(['a','b'])

💡 关于默认整数类型:从 NumPy 2.0 开始,所有平台上 np.array([1,2]) 默认都是 int64。在更早版本中,Windows 平台默认为 int32,Linux/macOS 为 int64。可用 arr.dtype 查看实际类型,跨平台代码建议显式指定 dtype。


3. 创建数组

import numpy as np

# 全 0 数组
np.zeros(5)            # [0. 0. 0. 0. 0.]
np.zeros((3, 4))       # 3行4列全 0

# 全 1 数组
np.ones(5)             # [1. 1. 1. 1. 1.]
np.ones((2, 3))        # 2行3列全 1

# 填充固定值
np.full(5, 3.14)       # [3.14 3.14 3.14 3.14 3.14]
np.full((2, 3), 7)     # 2行3列全 7

# 单位矩阵(对角线为1)
np.eye(3)              # 3x3 单位矩阵

# 等差数组
np.arange(0, 10, 2)    # [0 2 4 6 8](起始, 终止, 步长)
np.arange(5)           # [0 1 2 3 4]

# 等间隔数组(指定数量)
np.linspace(0, 1, 5)   # [0.   0.25 0.5  0.75 1. ](起始, 终止, 数量)

# 随机数组(最常用)
np.random.random((3,3))       # 0-1 均匀分布
np.random.randint(1, 100, 5)  # 随机整数
np.random.randn(3, 3)         # 标准正态分布

# 从已有数据创建
np.array([1, 2, 3])           # 从列表
np.arange(10)                  # 从范围
np.zeros_like(arr2d)           # 与 arr2d 同形状的全 0
np.ones_like(arr2d)            # 与 arr2d 同形状的全 1

4. 数组属性

import numpy as np
arr = np.array([[1, 2, 3],
                [4, 5, 6]])

# 形状
arr.shape        # (2, 3) → 2行3列

# 维度数
arr.ndim         # 2

# 元素总数
arr.size         # 6

# 数据类型
arr.dtype        # dtype('int64')

# 每个元素的字节大小
arr.itemsize     # 8(int64 占 8 字节;若为 int32 则为 4)

# 改变形状
arr.reshape(3, 2)   # 变为 3x2(元素数必须一致)
arr.flatten()        # 展平为一维 [1 2 3 4 5 6]
arr.T                # 转置(行变列,列变行)

# 改变形状(自动推断维度)
arr.reshape(3, -1)   # 3行,列数自动算(-1 表示自动)

5. 索引与切片

📋 一维数组(和列表一样)

arr = np.array([10, 20, 30, 40, 50])

arr[0]       # 10(第一个元素)
arr[-1]      # 50(最后一个)
arr[1:4]     # [20 30 40](切片)
arr[::2]     # [10 30 50](步长2)
arr[::-1]    # [50 40 30 20 10](反转)

📋 二维数组

arr = np.array([[1, 2, 3],
                [4, 5, 6],
                [7, 8, 9]])

# 基本索引
arr[0, 0]       # 1(第0行第0列)
arr[1, 2]       # 6(第1行第2列)
arr[2, -1]      # 9(第2行最后一列)

# 切片
arr[0:2, :]     # 前2行,所有列 → [[1,2,3],[4,5,6]]
arr[:, 0:2]     # 所有行,前2列 → [[1,2],[4,5],[7,8]]
arr[1, :]       # 第1行 → [4, 5, 6]
arr[:, 1]       # 第1列 → [2, 5, 8]

# 步长切片
arr[::2, ::2]   # 隔行隔列 → [[1,3],[7,9]]

💡 切片是视图,不是副本!

arr[0:2, :] 返回的是原数组的"视图"——修改切片会改变原数组。

需要独立副本时用 .copy():sub = arr[0:2, :].copy()

📋 布尔索引(条件筛选)

arr = np.array([10, 20, 30, 40, 50])

# 布尔条件
mask = arr > 25
print(mask)          # [False False  True  True  True]

# 用布尔数组筛选
arr[mask]            # [30 40 50]
arr[arr > 25]        # [30 40 50](一步到位)
arr[arr % 20 == 0]   # [20 40]

# 二维布尔索引
arr2d = np.array([[1, 2, 3],
                  [4, 5, 6],
                  [7, 8, 9]])
arr2d[arr2d > 5]     # [6 7 8 9](返回一维数组)

📋 花式索引(整数数组索引)

arr = np.array([10, 20, 30, 40, 50])

# 用整数数组取指定位置
indices = [0, 2, 4]
arr[indices]         # [10 30 50]

# 二维花式索引
arr2d = np.array([[1, 2, 3],
                  [4, 5, 6],
                  [7, 8, 9]])
arr2d[[0, 2], [1, 2]]  # 取 (0,1) 和 (2,2) → [2, 9]

6. 向量化运算

NumPy 的核心优势:不用 for 循环,直接对整个数组运算。

import numpy as np

a = np.array([1, 2, 3, 4, 5])
b = np.array([10, 20, 30, 40, 50])

# 算术运算(逐元素)
a + b       # [11 22 33 44 55]
a - b       # [-9 -18 -27 -36 -45]
a * b       # [10 40 90 160 250]
b / a       # [10. 10. 10. 10. 10.]
a ** 2      # [1 4 9 16 25](平方)
a % 2       # [1 0 1 0 1](取余)

# 标量运算(广播到每个元素)
a + 100     # [101 102 103 104 105]
a * 2       # [2 4 6 8 10]

# 比较运算(返回布尔数组)
a > 3       # [False False False  True  True]
a == 3      # [False False  True False False]

# 数学函数(逐元素)
np.sqrt(a)      # [1.   1.41 1.73 2.   2.24](平方根)
np.exp(a)       # [  2.72   7.39  20.09  54.60 148.41](e的幂)
np.log(a)       # [0.   0.69 1.10 1.39 1.61](自然对数)
np.sin(a)       # 正弦
np.abs([-1,2,-3])  # [1 2 3](绝对值)

💡 向量化 vs for 循环:

a + b 在底层是 C 语言循环,一行代码搞定。
用 Python 的 for 写同样的逻辑,慢 50-100 倍。

# 差的写法(Python for 循环)
result = [a[i]+b[i] for i in range(len(a))]

# 好的写法(NumPy 向量化)
result = a + b


7. 广播机制

当两个数组形状不同时,NumPy 会自动"广播"较小的数组,使其与较大的数组匹配。

import numpy as np

# 规则:从右往左比较维度
# 要么相同,要么其中一个为 1,否则报错

# 示例1:标量与数组
arr = np.array([[1, 2, 3],
                [4, 5, 6]])
arr + 10
# [[11 12 13]
#  [14 15 16]]
# 10 被"广播"成与 arr 同形状

# 示例2:一维与二维
arr = np.array([[1, 2, 3],
                [4, 5, 6]])   # shape: (2, 3)
row = np.array([10, 20, 30])  # shape: (3,)
arr + row
# [[11 22 33]
#  [14 25 36]]
# row 被广播到每一行

# 示例3:列向量与二维
col = np.array([[100],
                [200]])       # shape: (2, 1)
arr + col
# [[101 102 103]
#  [204 205 206]]
# col 被广播到每一列
# 广播规则图解
# arr:   2 x 3
# row:       3  → 广播为 2 x 3
# 结果:  2 x 3

# arr:   2 x 3
# col:   2 x 1 → 广播为 2 x 3
# 结果:  2 x 3

# 报错示例
# arr:   2 x 3
# other: 2     → 不能广播!(维度不匹配)

8. 常用函数

import numpy as np

arr = np.array([[1, 2, 3],
                [4, 5, 6]])

# 聚合函数
np.sum(arr)           # 21(所有元素求和)
np.sum(arr, axis=0)   # [5 7 9](按列求和)
np.sum(arr, axis=1)   # [6 15](按行求和)
np.mean(arr)          # 3.5(均值)
np.mean(arr, axis=0)  # [2.5 3.5 4.5](按列均值)
np.max(arr)           # 6
np.min(arr)           # 1
np.std(arr)           # 标准差
np.var(arr)           # 方差

# 累积
np.cumsum(arr)        # [1 3 6 10 15 21](累积和)
np.cumprod(arr)       # [1 2 6 24 120 720](累积积)

# 排序
np.sort(arr, axis=0)  # 按列排序
np.sort(arr, axis=1)  # 按行排序
np.argsort(arr)       # 排序后的索引

# 最值索引
np.argmax(arr)        # 5(最大值的索引,展平后)
np.argmin(arr)        # 0

# 唯一值
np.unique([1,2,2,3,3,3])  # [1 2 3]

# 条件替换
np.where(arr > 3, arr, 0)   # [[0 0 0][4 5 6]](大于3保留,否则0)

# 统计
np.count_nonzero(arr > 3)   # 3(大于3的元素个数)
np.any(arr > 5)              # True(至少一个大于5)
np.all(arr > 0)              # True(全部大于0)

9. 今日练习

🏋️ 练习 1:成绩统计

# 创建一个 5x3 的成绩矩阵(5个学生,3门课)
# 计算:每个学生的平均分、每门课的最高分、总排名

🏋️ 练习 2:图像旋转

# 用 NumPy 模拟图像旋转:
# 创建一个 4x4 的矩阵,用切片和转置实现 90° 旋转
# 提示:旋转90° = 转置 + 每行反转

🏋️ 练习 3:归一化

# 将一个数组归一化到 [0, 1] 区间
# 公式:(x - min) / (max - min)
# 要求:用向量化运算,不用 for 循环

10. 今日小结

知识点
核心内容
ndarray
多维数组,统一数据类型,连续内存
创建
np.array / zeros / ones / arange / linspace / random
索引
基本索引 / 切片 / 布尔索引 / 花式索引
向量化
逐元素运算,不用 for 循环,快 50-100 倍
广播
不同形状数组自动扩展匹配
聚合
sum / mean / max / min / std / cumsum

🚀 明日预告:Day 72 — NumPy 进阶

矩阵运算、随机数、统计函数、线性代数基础。为 Pandas 打好地基!

轻松时刻:

请在微信客户端打开

最新文章

随机文章