当前位置:首页>python>Python深度学习基于PyTorch-第2版-项目集(01)

Python深度学习基于PyTorch-第2版-项目集(01)

  • 2026-09-05 11:31:10
Python深度学习基于PyTorch-第2版-项目集(01)

《Python深度学习基于PyTorch(第2版)》—项目集

为什么有了【习题集】还要再推出一套【项目集】?

我们当初编写习题集,是希望帮助大家查漏补缺、夯实基础。但习题集终究偏重“知识点”的训练,覆盖维度相对单一,难以呈现完整的项目实战面貌。因此,作为习题集的重要补充,我们正在同步打造一套“源于本书、又高于本书”的配套【项目集】。

每一个项目体现实战性、工程化思维。我们希望这套项目集不仅能巩固所学,更能帮助大家把零散的知识,沉淀为一个个有亮点、能讲透、甚至能打动面试官的精品项目,让你在学习、求职和工作中,真正脱颖而出!

一、项目名称:

《用NumPy手写回归到PyTorch自动微分的四阶段演进》

二、项目实施步骤总览

三、四阶段详细演进:代码结构对比 

第1阶段到第2阶段:

第3阶段到第4阶段

 四、核心挑战—理解backward()核心机制

手工求导繁琐,而且只适合简单任务,解决复杂模型不现实,必须借助 backward() 自动求导来提升效率;但这把“利器”也有使用门槛,下面我们就深入剖析其核心机制,避免踩坑。

1.loss.backward()默认梯度累加机制,多轮反向传播梯度会累加.grad属性,不会自动清空;若不手动zero_(),每一轮梯度不断累积(怎么累积?如下图所示),梯度值越来越大,参数更新步长失控,损失震荡爆炸、无法收敛。

所以梯度清零的正确的方法是:

(1)不使用optimizer时,手工更新参数之后,手工梯度清零(如第3阶段)

(2)使用 optimizer 时,使用optimizer.zero_grad()进行梯度清理,该句可放在optimizer.step () 参数更新之后,或loss.backward () 之前。(如第四阶段)。

【注意】梯度清零语句,不能放在loss.backward ()和optimizer.step ()之间。为什么?

2.自动求导,更新参数时如果去掉 with torch.no_grad() 会怎样?

w = torch.zeros(1, 1, requires_grad=True)

# ...

loss.backward()

#这里缺少不跟踪梯度的语句

w -= lr * w.grad# ❌ 错误:缺少 with torch.no_grad()

 运行结果:

runtimeError: a leaf Variable that requires grad is being used in an in-place operation.

3.根本原因

w -= lr * w.grad 等价于 w.sub_(lr * w.grad),这是一个 in-place 操作(直接修改内存)。

当 w.requires_grad=True 时:

·每次前向传播会构建一个计算图(Computational Graph)

·w 是计算图的叶子节点,其他节点可能引用了 w

·in-place 修改 w 后,计算图变得不一致(stale graph)

·下一轮 backward() 时,PyTorch 检测到不一致,抛出 RuntimeError

4.手动更新参数时,为什么要加这句with torch.no_grad(),这句的作用是什么?

作用

说明

关闭梯度追踪

不构建新的计算图

允许 in-place 操作

可以修改 requires_grad=True 的 Tensor

节省内存

参数更新本身不需要计算梯度

5.正确代码

不使用优化器时 

loss.backward()

with torch.no_grad():

w-= lr * w.grad# ✅ 正确

自动更新或使用优化器时,就简单多了,多句合为一句,而且还更高效!

loss.backward()

optimizer.step ()# ✅ 正确

 由此可知,不使用优化器时的这三句,等于使用优化器的一句,如下图所示(这个关系上个视频已介绍)

五、小结与拓展:

1.小结

以上这个回归任务,实际上可以用一个简单模型(即只一个神经元,且没有激活函数)来表示,输入为,对应权重为w,偏移量为b,感知机中表达式为,感知机的输出为y,。

2.拓展:

表达式是一个复杂函数(如,甚至没有表达式的情况,如何处理?如何构建相应模型?

理论上,多层神经网络可以拟合任何曲线。神经网络相关项目下个视频将介绍,敬请关注! 

 资料获取途径

视频连接:

抖音账号:84911487035

B站主页:https://space.bilibili.com/391424656

微信公众号【含电子文档及代码等】:大模型大智慧

六、附录【项目完整代码】

"""

====================================================================

项目:从NumPy到PyTorch —— 四阶段渐进式回归实现

目标:拟合 y = 3x^2 + 2 + noise

更新:第4阶段不使用nn工具包,仅使用optimizer + F.mse_loss

====================================================================

""" 

import numpy as np

import matplotlib.pyplot as plt

import torch

import torch.nn.functional as F

import warnings

warnings.filterwarnings('ignore')

# 设置中文字体

plt.rcParams['font.sans-serif'] = ['SimHei', 'DejaVu Sans']

plt.rcParams['axes.unicode_minus'] = False

# ==================== 公共数据准备 ====================

np.random.seed(42)

N = 100

x_np = np.linspace(-3, 3, N)

y_true = 3 * x_np**2 + 2

noise = np.random.normal(0, 0.5, N)

y_np = y_true + noise

print("=" * 70)

print("📊 数据准备完成")

print(f"样本数: {N}")

print(f"真实函数: y = 3x² + 2")

print(f"噪声标准差: 0.5")

print("=" * 70)

# ============================================================

# 第1阶段:NumPy从零实现

# 核心:手动前向传播 + 手动解析求导 + 手动参数更新

# ============================================================

print("\n" + "=" * 70)

print("🔧 第1阶段:NumPy从零实现机器学习回归")

print("=" * 70)

# 模型: y_hat = w1 * x^2 + w2 * x + b

w1, w2, b = 0.1, 0.1, 0.1

lr = 0.001

epochs = 2000

loss_history_p1 = []

w1_h1, w2_h1, b_h1 = [], [], []

pred_history_p1 = []

print(f"\n初始参数: w1={w1:.4f}, w2={w2:.4f}, b={b:.4f}")

print(f"学习率: {lr}, 迭代次数: {epochs}")

for epoch in range(epochs):

y_hat= w1 * x_np**2 + w2 * x_np + b

loss= np.mean((y_np - y_hat)**2)

loss_history_p1.append(loss)

#手动解析求导

grad_w1= -2 * np.mean((y_np - y_hat) * x_np**2)

grad_w2= -2 * np.mean((y_np - y_hat) * x_np)

grad_b= -2 * np.mean(y_np - y_hat)

#手动参数更新

w1-= lr * grad_w1

w2-= lr * grad_w2

b-= lr * grad_b

w1_h1.append(w1);w2_h1.append(w2); b_h1.append(b)

ifepoch % 100 == 0:

pred_history_p1.append(y_hat.copy())

ifepoch % 500 == 0:

print(f"Epoch{epoch:4d}: loss={loss:.6f}, w1={w1:.4f}, w2={w2:.4f}, b={b:.4f}")

print(f"\n✅ 阶段1完成! 最终: w1={w1:.4f}, w2={w2:.4f}, b={b:.4f}, loss={loss:.6f}")

# ============================================================

# 第2阶段:PyTorch实现,不使用autograd/optimizer

# 核心:Tensor替代ndarray,但手动求导和手动更新

# ============================================================

print("\n" + "=" * 70)

print("⚡ 第2阶段:PyTorch Tensor实现(无autograd/optimizer)")

print("=" * 70)

x_tensor = torch.tensor(x_np, dtype=torch.float32)

y_tensor = torch.tensor(y_np, dtype=torch.float32)

# 关键点:requires_grad=False

w1 = torch.tensor(0.1, dtype=torch.float32)

w2 = torch.tensor(0.1, dtype=torch.float32)

b = torch.tensor(0.1, dtype=torch.float32)

lr = 0.001

epochs = 2000

loss_history_p2 = []

w1_h2, w2_h2, b_h2 = [], [], []

pred_history_p2 = []

print(f"\n初始参数: w1={w1.item():.4f}, w2={w2.item():.4f}, b={b.item():.4f}")

print("⚠️ 关键点: requires_grad=False,Tensor只是GPU加速的ndarray")

for epoch in range(epochs):

y_hat= w1 * x_tensor**2 + w2 * x_tensor + b

loss= torch.mean((y_tensor - y_hat)**2)

loss_history_p2.append(loss.item())

#仍手动解析求导!

grad_w1= -2 * torch.mean((y_tensor - y_hat) * x_tensor**2)

grad_w2= -2 * torch.mean((y_tensor - y_hat) * x_tensor)

grad_b= -2 * torch.mean(y_tensor - y_hat)

#手动参数更新

w1-= lr * grad_w1

w2-= lr * grad_w2

b-= lr * grad_b

w1_h2.append(w1.item());w2_h2.append(w2.item()); b_h2.append(b.item())

ifepoch % 100 == 0:

pred_history_p2.append(y_hat.detach().numpy().copy())

ifepoch % 500 == 0:

print(f"Epoch{epoch:4d}: loss={loss.item():.6f}, w1={w1.item():.4f}, w2={w2.item():.4f}, b={b.item():.4f}")

print(f"\n✅ 阶段2完成! 最终: w1={w1.item():.4f}, w2={w2.item():.4f}, b={b.item():.4f}, loss={loss.item():.6f}")

# ============================================================

# 第3阶段:增加autograd自动微分

# 核心:backward()自动求导,但仍手动更新参数

# 关注点:计算图、梯度清零、叶子节点

# ============================================================

print("\n" + "=" * 70)

print("🧬 第3阶段:PyTorch + Autograd自动微分")

print("=" * 70)

# 关键点:requires_grad=True,让PyTorch追踪计算图

w1 = torch.tensor(0.1, dtype=torch.float32, requires_grad=True)

w2 = torch.tensor(0.1, dtype=torch.float32, requires_grad=True)

b = torch.tensor(0.1, dtype=torch.float32, requires_grad=True)

lr = 0.001

epochs = 2000

loss_history_p3 = []

w1_h3, w2_h3, b_h3 = [], [], []

pred_history_p3 = []

print(f"\n初始参数: w1={w1.item():.4f}, w2={w2.item():.4f}, b={b.item():.4f}")

print("⚠️ 关键点:")

print("1. requires_grad=True → PyTorch自动构建计算图")

print("2. loss.backward() → 自动计算所有梯度")

print("3. w1.grad.zero_() → 必须手动清零梯度!")

print("4. with torch.no_grad() → 参数更新时不构建计算图")

for epoch in range(epochs):

#===== 前向传播(自动构建计算图)=====

y_hat= w1 * x_tensor**2 + w2 * x_tensor + b

loss= torch.mean((y_tensor - y_hat)**2)

loss_history_p3.append(loss.item())

#===== 反向传播(一行替代所有手动求导!)=====

loss.backward()

#===== 参数更新(仍手动,但用计算出的梯度)=====

#必须用no_grad,否则更新操作也会被记录到计算图中

withtorch.no_grad():

w1-= lr * w1.grad

w2-= lr * w2.grad

b-= lr * b.grad

#⚠️ 关键!梯度不清零会累积!

w1.grad.zero_()

w2.grad.zero_()

b.grad.zero_()

w1_h3.append(w1.item());w2_h3.append(w2.item()); b_h3.append(b.item())

ifepoch % 100 == 0:

pred_history_p3.append(y_hat.detach().numpy().copy())

ifepoch % 500 == 0:

print(f"Epoch{epoch:4d}: loss={loss.item():.6f}, w1={w1.item():.4f}, w2={w2.item():.4f}, b={b.item():.4f}")

print(f"\n✅ 阶段3完成! 最终: w1={w1.item():.4f}, w2={w2.item():.4f}, b={b.item():.4f}, loss={loss.item():.6f}")

# ============================================================

# 第4阶段:不使用nn工具包,仅增加optimizer和F.mse_loss

# 核心:用torch.optim.SGD + torch.nn.functional.mse_loss

# 参数仍用requires_grad=True的Tensor,不用nn.Parameter

# ============================================================

print("\n" + "=" * 70)

print("🚀 第4阶段:不使用nn工具包,仅增加optimizer + F.mse_loss")

print("=" * 70)

# 参数仍使用普通Tensor + requires_grad=True(不用nn.Parameter)

w1 = torch.tensor(0.1, dtype=torch.float32, requires_grad=True)

w2 = torch.tensor(0.1, dtype=torch.float32, requires_grad=True)

b = torch.tensor(0.1, dtype=torch.float32, requires_grad=True)

# 将参数放入列表,供optimizer使用

params = [w1, w2, b]

# ===== 使用torch.optim.SGD优化器 =====

# optimizer会自动管理params列表中所有requires_grad=True的Tensor

optimizer = torch.optim.SGD(params, lr=0.001)

epochs = 2000

loss_history_p4 = []

w1_h4, w2_h4, b_h4 = [], [], []

pred_history_p4 = []

print(f"\n初始参数: w1={w1.item():.4f}, w2={w2.item():.4f}, b={b.item():.4f}")

print("⚠️ 关键点:")

print("1. 参数仍是普通Tensor(requires_grad=True),不用nn.Parameter")

print("2. 使用torch.nn.functional.mse_loss(函数式API,不用nn.MSELoss类)")

print("3. 使用torch.optim.SGD(params, lr)管理参数更新")

print("4. optimizer.step() 等价于: w1 -= lr * w1.grad(对所有参数)")

print("5. optimizer.zero_grad() 等价于: w1.grad.zero_()(对所有参数)")

for epoch in range(epochs):

#===== 前向传播 =====

y_hat= w1 * x_tensor**2 + w2 * x_tensor + b

#===== 使用F.mse_loss计算损失(函数式,不用nn.Module)=====

loss= F.mse_loss(y_hat, y_tensor)# 等价于 torch.mean((y_hat - y_tensor)**2)

loss_history_p4.append(loss.item())

#===== 反向传播 =====

optimizer.zero_grad()#一行清零所有参数梯度!

loss.backward()#计算梯度

#===== 参数更新 =====

optimizer.step()#一行完成所有参数更新!

w1_h4.append(w1.item())

w2_h4.append(w2.item())

b_h4.append(b.item())

ifepoch % 100 == 0:

pred_history_p4.append(y_hat.detach().numpy().copy())

ifepoch % 500 == 0:

print(f"Epoch{epoch:4d}: loss={loss.item():.6f}, w1={w1.item():.4f}, w2={w2.item():.4f}, b={b.item():.4f}")

print(f"\n✅ 阶段4完成! 最终: w1={w1.item():.4f}, w2={w2.item():.4f}, b={b.item():.4f}, loss={loss.item():.6f}")

print("\n📌 验证:阶段4与阶段3数学完全等价,只是将手动更新封装到optimizer中")

# ============================================================

# 可视化:四阶段对比

# ============================================================

fig = plt.figure(figsize=(20, 10))

colors = ['#ff6b6b', '#ffd93d', '#6bcb77', '#4d96ff']

labels = ['Phase 1: NumPy', 'Phase 2: PyTorch Tensor', 'Phase 3: + Autograd', 'Phase 4: + Optimizer/F.loss']

# 计算最终预测值

final_pred_p1 = np.array(w1_h1[-1]) * x_np**2 + np.array(w2_h1[-1]) * x_np + np.array(b_h1[-1])

final_pred_p2 = np.array(w1_h2[-1]) * x_np**2 + np.array(w2_h2[-1]) * x_np + np.array(b_h2[-1])

final_pred_p3 = np.array(w1_h3[-1]) * x_np**2 + np.array(w2_h3[-1]) * x_np + np.array(b_h3[-1])

final_pred_p4 = np.array(w1_h4[-1]) * x_np**2 + np.array(w2_h4[-1]) * x_np + np.array(b_h4[-1])

# 1. 损失下降曲线对比

ax1 = fig.add_subplot(2, 4, 1)

for loss_hist, color, label in zip([loss_history_p1, loss_history_p2, loss_history_p3, loss_history_p4], colors, labels):

ax1.plot(loss_hist,color=color, alpha=0.8, linewidth=2, label=label)

ax1.set_xlabel('Epoch')

ax1.set_ylabel('MSE Loss')

ax1.set_title('📉 损失下降曲线对比', fontweight='bold')

ax1.legend(fontsize=9)

ax1.set_yscale('log')

ax1.grid(True, alpha=0.3)

# 2. 参数收敛过程:w1

ax2 = fig.add_subplot(2, 4, 2)

for w1_hist, color, label in zip([w1_h1, w1_h2, w1_h3, w1_h4], colors, labels):

ax2.plot(w1_hist,color=color, alpha=0.8, linewidth=2, label=label)

ax2.axhline(y=3, color='black', linestyle='--', alpha=0.5, label='True w1=3')

ax2.set_xlabel('Epoch')

ax2.set_ylabel('w1 value')

ax2.set_title('📊 参数 w1 收敛过程', fontweight='bold')

ax2.legend(fontsize=9)

ax2.grid(True, alpha=0.3)

# 3. 参数收敛过程:b

ax3 = fig.add_subplot(2, 4, 3)

for b_hist, color, label in zip([b_h1, b_h2, b_h3, b_h4], colors, labels):

ax3.plot(b_hist,color=color, alpha=0.8, linewidth=2, label=label)

ax3.axhline(y=2, color='black', linestyle='--', alpha=0.5, label='True b=2')

ax3.set_xlabel('Epoch')

ax3.set_ylabel('b value')

ax3.set_title('📊 参数 b 收敛过程', fontweight='bold')

ax3.legend(fontsize=9)

ax3.grid(True, alpha=0.3)

# 4. 代码复杂度对比

ax4 = fig.add_subplot(2, 4, 4)

metrics = ['手动求导行数', '手动更新行数', '梯度清零行数', '总代码行数']

phase1_vals = [3, 3, 0, 25]

phase2_vals = [3, 3, 0, 23]

phase3_vals = [0, 6, 3, 22]

phase4_vals = [0, 0, 0, 18]

x_pos = np.arange(len(metrics))

width = 0.2

ax4.bar(x_pos - 1.5*width, phase1_vals, width, label='Phase 1', color=colors[0], alpha=0.8)

ax4.bar(x_pos - 0.5*width, phase2_vals, width, label='Phase 2', color=colors[1], alpha=0.8)

ax4.bar(x_pos + 0.5*width, phase3_vals, width, label='Phase 3', color=colors[2], alpha=0.8)

ax4.bar(x_pos + 1.5*width, phase4_vals, width, label='Phase 4', color=colors[3], alpha=0.8)

ax4.set_xticks(x_pos)

ax4.set_xticklabels(metrics, fontsize=10)

ax4.set_title('📊 代码复杂度对比', fontweight='bold')

ax4.legend(fontsize=9)

ax4.grid(True, alpha=0.3, axis='y')

# 5-8. 各阶段最终拟合效果

preds = [final_pred_p1, final_pred_p2, final_pred_p3, final_pred_p4]

for idx in range(4):

ax= fig.add_subplot(2, 4, 5 + idx)

ax.scatter(x_np,y_np, alpha=0.3, s=20, color='gray', label='Data')

ax.plot(x_np,y_true, 'k--', linewidth=2, label='True: y=3x²+2')

ax.plot(x_np,preds[idx], color=colors[idx], linewidth=2.5, label=f'{labels[idx]}\nFinal Fit')

ax.set_title(f'{labels[idx]}',fontweight='bold', color=colors[idx])

ax.legend(fontsize=8)

ax.grid(True,alpha=0.3)

plt.tight_layout()

plt.savefig('four_phases_comparison.png', dpi=150, bbox_inches='tight')

plt.show()

print("\n✅ 可视化完成!")

运行结果:

===========================================================

📊 数据准备完成

样本数:100

真实函数:y = 3x² + 2

噪声标准差:0.5

==========================================================

🔧 第1阶段:NumPy从零实现机器学习回归

==========================================================

初始参数: w1=0.1000, w2=0.1000, b=0.1000

学习率: 0.001, 迭代次数: 2000

Epoch0:loss=178.675044, w1=0.2092, w2=0.0995, b=0.1214

Epoch500:loss=0.488656, w1=3.1594, w2=0.0156, b=1.1162

Epoch1000: loss=0.323823, w1=3.1072, w2=0.0117, b=1.3960

Epoch1500: loss=0.254097, w1=3.0733, w2=0.0115, b=1.5781

✅ 阶段1完成! 最终: w1=3.0513, w2=0.0115, b=1.6963, loss=0.224630

===========================================================

⚡ 第2阶段:PyTorch Tensor实现(无autograd/optimizer)

==========================================================

初始参数: w1=0.1000, w2=0.1000, b=0.1000

⚠️ 关键点: requires_grad=False,Tensor只是GPU加速的ndarray

Epoch0:loss=178.675034, w1=0.2092, w2=0.0995, b=0.1214

Epoch500:loss=0.488656, w1=3.1594, w2=0.0156, b=1.1162

Epoch1000: loss=0.323824, w1=3.1072, w2=0.0117, b=1.3960

Epoch1500: loss=0.254097, w1=3.0733, w2=0.0115, b=1.5781

✅ 阶段2完成! 最终: w1=3.0513, w2=0.0115, b=1.6963, loss=0.224630

===========================================================

🧬 第3阶段:PyTorch + Autograd自动微分

===========================================================

初始参数: w1=0.1000, w2=0.1000, b=0.1000

⚠️ 关键点:

1.requires_grad=True → PyTorch自动构建计算图

2.loss.backward() → 自动计算所有梯度

3.w1.grad.zero_() → 必须手动清零梯度!

4.with torch.no_grad() → 参数更新时不构建计算图

Epoch0:loss=178.675034, w1=0.2092, w2=0.0995, b=0.1214

Epoch500:loss=0.488656, w1=3.1594, w2=0.0156, b=1.1162

Epoch1000: loss=0.323824, w1=3.1072, w2=0.0117, b=1.3960

Epoch1500: loss=0.254097, w1=3.0733, w2=0.0115, b=1.5781

✅ 阶段3完成! 最终: w1=3.0513, w2=0.0115, b=1.6963, loss=0.224630

===========================================================

🚀 第4阶段:不使用nn工具包,仅增加optimizer + F.mse_loss

===========================================================

初始参数: w1=0.1000, w2=0.1000, b=0.1000

⚠️ 关键点:

1.参数仍是普通Tensor(requires_grad=True),不用nn.Parameter

2.使用torch.nn.functional.mse_loss(函数式API,不用nn.MSELoss类)

3.使用torch.optim.SGD(params, lr)管理参数更新

4.optimizer.step() 等价于: w1 -= lr * w1.grad(对所有参数)

5.optimizer.zero_grad() 等价于: w1.grad.zero_()(对所有参数)

Epoch0:loss=178.675034, w1=0.2092, w2=0.0995, b=0.1214

Epoch500:loss=0.488656, w1=3.1594, w2=0.0156, b=1.1162

Epoch1000: loss=0.323824, w1=3.1072, w2=0.0117, b=1.3960

Epoch1500: loss=0.254097, w1=3.0733, w2=0.0115, b=1.5781

✅ 阶段4完成! 最终: w1=3.0513, w2=0.0115, b=1.6963, loss=0.224630

📌 验证:阶段4与阶段3数学完全等价,只是将手动更新封装到optimizer中

最新文章

随机文章