当前位置:首页>python>代码报错找不到原因?Python logging 5分钟实战,科研调试效率翻倍

代码报错找不到原因?Python logging 5分钟实战,科研调试效率翻倍

  • 2026-09-09 08:02:52
代码报错找不到原因?Python logging 5分钟实战,科研调试效率翻倍

上周帮师弟排查一个跑了一周的实验脚本,程序凌晨3点崩溃,屏幕上只留下一行IndexError: list index out of range。他一脸懵:"我只改了数据路径,怎么会越界?"

打开他的代码,到处都是print('here')和print(x.shape),关键变量的值根本没留下来,报错现场已经丢了。用print调试科研代码,就像用创可贴修水管——临时止血,下次还漏。

后来我让他把print全换成logging,加了个文件记录。第二天同样的问题复现时,我们直接翻到日志文件,看到崩溃前10秒的完整变量状态,10分钟定位到bug。

今天分享Python logging的3个实战技巧,从"只会print"到"5分钟定位问题"。文末附可直接复制的配置代码,关注后回复【logging】领取完整模板。

为什么print不适合科研代码?

print的问题不是不能用,是不适合长期调试和复现实验:

场景
print
logging
信息分级
全部一样,重要信息被淹没
DEBUG/INFO/WARNING/ERROR/CRITICAL
保存日志
终端关了就没,远程跑实验抓瞎
自动写入文件,离线也能复盘
异常追踪
只看到最后一行报错
自动记录完整traceback和上下文
线上/服务器
nohup.out里一堆输出,难过滤
按级别过滤,按日期轮转
生产发布
需要手动删除调试print
改个级别即可,代码不用删

科研场景的特殊性在于:实验经常跑几小时甚至几天,崩溃时你不在电脑旁边。没有持久化日志,基本等于白跑。

技巧1:分级记录,避免被无关信息淹没

logging默认有5个级别,对应不同严重程度:

级别
用途
科研场景示例
DEBUG
调试细节
打印每个batch的loss、tensor shape
INFO
正常运行信息
实验开始、参数配置、epoch进度
WARNING
警告但不致命
学习率衰减到阈值、数据缺失用默认值填充
ERROR
出错了但程序还能跑
某条数据读取失败,跳过继续
CRITICAL
严重错误,程序应停止
GPU显存不足、配置文件缺失

分级的好处是:开发时把级别设成DEBUG看细节,正式跑实验设成INFO只保留关键信息,出了问题再调回DEBUG复现。不用改代码,改级别就行。

技巧2:同时输出到控制台和文件

科研代码最常见的配置:屏幕上只看进度,文件里记完整日志。这样终端清爽,事后又能复盘。

配置代码(可直接复制):

import logging import sys from datetime import datetime  def setup_logger(log_dir='logs'):     import os     os.makedirs(log_dir, exist_ok=True)          # 日志文件名带时间戳,避免覆盖     log_file = os.path.join(log_dir, f"exp_{datetime.now():%Y%m%d_%H%M%S}.log")          # 创建logger     logger = logging.getLogger('research')     logger.setLevel(logging.DEBUG)  # 捕获所有级别          # 文件处理器:记录所有DEBUG及以上信息     file_handler = logging.FileHandler(log_file, encoding='utf-8')     file_handler.setLevel(logging.DEBUG)     file_format = logging.Formatter(         '%(asctime)s | %(levelname)-8s | %(filename)s:%(lineno)d | %(message)s'     )     file_handler.setFormatter(file_format)          # 控制台处理器:只显示INFO及以上     console_handler = logging.StreamHandler(sys.stdout)     console_handler.setLevel(logging.INFO)     console_format = logging.Formatter('%(levelname)s: %(message)s')     console_handler.setFormatter(console_format)          logger.addHandler(file_handler)     logger.addHandler(console_handler)     return logger  logger = setup_logger()

使用时:

logger.info('实验开始,数据集:CIFAR-10') logger.debug(f'batch shape: {images.shape}, labels: {labels.shape}') logger.warning('学习率已衰减到1e-6,建议检查收敛性') logger.error(f'读取文件失败,跳过: {file_path}')

输出效果:

INFO: 实验开始,数据集:CIFAR-10 2025-08-15 06:30:15 | DEBUG    | train.py:42 | batch shape: (32, 3, 32, 32), labels: (32,) 2025-08-15 06:30:18 | WARNING  | train.py:58 | 学习率已衰减到1e-6,建议检查收敛性

注意:logging.getLogger('research')用同一个名字,保证在多个文件里拿到同一个logger实例,避免重复输出。

技巧3:异常自动捕获,保留崩溃现场

科研代码最痛苦的不是报错,是报错后不知道当时的状态。用logging的exception方法,可以自动记录完整traceback和异常信息。

try:     result = model(input_data)     logger.info(f'推理成功,输出shape: {result.shape}') except Exception:     logger.exception('模型推理失败,输入shape=%s', input_data.shape)     raise

logger.exception会自动把当前异常的traceback写入日志,不需要手动import traceback。

进阶做法:给整个训练流程加一个全局捕获,程序崩溃时自动发通知或保存checkpoint:

def main():     try:         train()     except Exception:         logger.exception('训练过程发生未捕获异常')         # 可以在这里加:保存临时模型、发送邮件/钉钉通知         save_emergency_checkpoint()         raise  if __name__ == '__main__':     main()

科研场景实战:5分钟改造现有代码

假设你原来的训练脚本长这样:

for epoch in range(epochs):     print(f'Epoch {epoch}')     for batch in dataloader:         print(batch.shape)         loss = train_step(batch)         print(f'loss: {loss}')

改造后:

logger = setup_logger() logger.info('训练开始 | epochs=%d | lr=%.1e', epochs, lr)  for epoch in range(epochs):     logger.info('Epoch %d / %d', epoch, epochs)     for batch_idx, batch in enumerate(dataloader):         logger.debug('batch %d shape=%s', batch_idx, batch.shape)         try:             loss = train_step(batch)             if batch_idx % 10 == 0:                 logger.info('batch %d loss=%.4f', batch_idx, loss)         except Exception:             logger.exception('训练失败 | epoch=%d batch=%d', epoch, batch_idx)             raise

核心变化:

  • print
    换logger.info/debug
  • 关键实验参数用%格式化,避免字符串拼接开销
  • 训练步骤加try/except,崩溃时保留上下文
  • 高频调试信息用DEBUG级别,默认不显示在控制台

免费vs付费说明

工具
用途
费用
logging
Python标准库,基础日志功能
免费
loguru
更现代化的第三方日志库,API更简洁
免费开源
WandB / TensorBoard
实验指标可视化,和日志互补
个人免费

对于绝大多数科研场景,标准库logging完全够用。loguru适合想少写点配置代码的人。

3个常见坑

坑1:每次新建logger导致重复输出。 如果每次调用logging.getLogger()都加一遍handler,同一条日志会被打印多次。正确做法是用同一个名字获取logger,或者判断if not logger.handlers:再加handler。

坑2:日志文件越来越大不清理。 长期跑实验的日志可能占满磁盘。用RotatingFileHandler按大小自动切分,或TimedRotatingFileHandler按天切分。

坑3:不传exc_info就看不到traceback。 在except块里如果只用logger.error('出错'),不会记录traceback。要用logger.exception()或logger.error('出错', exc_info=True)。

5分钟上手清单

步骤
动作
耗时
1
复制上面的setup_logger配置到项目入口
1分钟
2
把关键print换成logger.info/debug
2分钟
3
在训练循环外加try/except捕获异常
1分钟
4
跑一次实验,检查logs目录下文件
1分钟

关注后回复【logging】,领取

  • 科研代码logging完整配置模板(含分级/文件/控制台/异常捕获)
  • loguru版极简配置(更适合快速上手)
  • RotatingFileHandler自动轮转代码
  • 异常自动保存checkpoint的模板
  • logging常见坑自查清单

你平时调试科研代码用print多,还是已经用logging了?遇到过最崩溃的一次bug是什么?评论区聊聊,点赞最高的下次专门出一期"科研代码debug实战"。

这是「科研人效率工具系列」第 34 期,上期:导师说论文Method部分像流水账?这套结构化写法让审稿人一眼看懂你的方法。下期预告:导师让你跟踪10个期刊的最新论文?用AI自动监控+摘要翻译,每天省1小时。

— 关注「科研创新社」,每天一个科研效率提升技巧 —

最新文章

随机文章