上周帮师弟排查一个跑了一周的实验脚本,程序凌晨3点崩溃,屏幕上只留下一行IndexError: list index out of range。他一脸懵:"我只改了数据路径,怎么会越界?"
打开他的代码,到处都是print('here')和print(x.shape),关键变量的值根本没留下来,报错现场已经丢了。用print调试科研代码,就像用创可贴修水管——临时止血,下次还漏。
后来我让他把print全换成logging,加了个文件记录。第二天同样的问题复现时,我们直接翻到日志文件,看到崩溃前10秒的完整变量状态,10分钟定位到bug。
今天分享Python logging的3个实战技巧,从"只会print"到"5分钟定位问题"。文末附可直接复制的配置代码,关注后回复【logging】领取完整模板。
为什么print不适合科研代码?
print的问题不是不能用,是不适合长期调试和复现实验:
| | |
|---|
| | DEBUG/INFO/WARNING/ERROR/CRITICAL |
| | |
| | |
| | |
| | |
科研场景的特殊性在于:实验经常跑几小时甚至几天,崩溃时你不在电脑旁边。没有持久化日志,基本等于白跑。
技巧1:分级记录,避免被无关信息淹没
logging默认有5个级别,对应不同严重程度:
| | |
|---|
| | 打印每个batch的loss、tensor shape |
| | |
| | |
| | |
| | |
分级的好处是:开发时把级别设成DEBUG看细节,正式跑实验设成INFO只保留关键信息,出了问题再调回DEBUG复现。不用改代码,改级别就行。
技巧2:同时输出到控制台和文件
科研代码最常见的配置:屏幕上只看进度,文件里记完整日志。这样终端清爽,事后又能复盘。
配置代码(可直接复制):
import logging import sys from datetime import datetime def setup_logger(log_dir='logs'): import os os.makedirs(log_dir, exist_ok=True) # 日志文件名带时间戳,避免覆盖 log_file = os.path.join(log_dir, f"exp_{datetime.now():%Y%m%d_%H%M%S}.log") # 创建logger logger = logging.getLogger('research') logger.setLevel(logging.DEBUG) # 捕获所有级别 # 文件处理器:记录所有DEBUG及以上信息 file_handler = logging.FileHandler(log_file, encoding='utf-8') file_handler.setLevel(logging.DEBUG) file_format = logging.Formatter( '%(asctime)s | %(levelname)-8s | %(filename)s:%(lineno)d | %(message)s' ) file_handler.setFormatter(file_format) # 控制台处理器:只显示INFO及以上 console_handler = logging.StreamHandler(sys.stdout) console_handler.setLevel(logging.INFO) console_format = logging.Formatter('%(levelname)s: %(message)s') console_handler.setFormatter(console_format) logger.addHandler(file_handler) logger.addHandler(console_handler) return logger logger = setup_logger()使用时:
logger.info('实验开始,数据集:CIFAR-10') logger.debug(f'batch shape: {images.shape}, labels: {labels.shape}') logger.warning('学习率已衰减到1e-6,建议检查收敛性') logger.error(f'读取文件失败,跳过: {file_path}')输出效果:
INFO: 实验开始,数据集:CIFAR-10 2025-08-15 06:30:15 | DEBUG | train.py:42 | batch shape: (32, 3, 32, 32), labels: (32,) 2025-08-15 06:30:18 | WARNING | train.py:58 | 学习率已衰减到1e-6,建议检查收敛性
注意:logging.getLogger('research')用同一个名字,保证在多个文件里拿到同一个logger实例,避免重复输出。
技巧3:异常自动捕获,保留崩溃现场
科研代码最痛苦的不是报错,是报错后不知道当时的状态。用logging的exception方法,可以自动记录完整traceback和异常信息。
try: result = model(input_data) logger.info(f'推理成功,输出shape: {result.shape}') except Exception: logger.exception('模型推理失败,输入shape=%s', input_data.shape) raiselogger.exception会自动把当前异常的traceback写入日志,不需要手动import traceback。
进阶做法:给整个训练流程加一个全局捕获,程序崩溃时自动发通知或保存checkpoint:
def main(): try: train() except Exception: logger.exception('训练过程发生未捕获异常') # 可以在这里加:保存临时模型、发送邮件/钉钉通知 save_emergency_checkpoint() raise if __name__ == '__main__': main()科研场景实战:5分钟改造现有代码
假设你原来的训练脚本长这样:
for epoch in range(epochs): print(f'Epoch {epoch}') for batch in dataloader: print(batch.shape) loss = train_step(batch) print(f'loss: {loss}')改造后:
logger = setup_logger() logger.info('训练开始 | epochs=%d | lr=%.1e', epochs, lr) for epoch in range(epochs): logger.info('Epoch %d / %d', epoch, epochs) for batch_idx, batch in enumerate(dataloader): logger.debug('batch %d shape=%s', batch_idx, batch.shape) try: loss = train_step(batch) if batch_idx % 10 == 0: logger.info('batch %d loss=%.4f', batch_idx, loss) except Exception: logger.exception('训练失败 | epoch=%d batch=%d', epoch, batch_idx) raise核心变化:
免费vs付费说明
对于绝大多数科研场景,标准库logging完全够用。loguru适合想少写点配置代码的人。
3个常见坑
坑1:每次新建logger导致重复输出。 如果每次调用logging.getLogger()都加一遍handler,同一条日志会被打印多次。正确做法是用同一个名字获取logger,或者判断if not logger.handlers:再加handler。
坑2:日志文件越来越大不清理。 长期跑实验的日志可能占满磁盘。用RotatingFileHandler按大小自动切分,或TimedRotatingFileHandler按天切分。
坑3:不传exc_info就看不到traceback。 在except块里如果只用logger.error('出错'),不会记录traceback。要用logger.exception()或logger.error('出错', exc_info=True)。
5分钟上手清单
| | |
|---|
| | |
| 把关键print换成logger.info/debug | |
| | |
| | |
关注后回复【logging】,领取
- 科研代码logging完整配置模板(含分级/文件/控制台/异常捕获)
- RotatingFileHandler自动轮转代码
你平时调试科研代码用print多,还是已经用logging了?遇到过最崩溃的一次bug是什么?评论区聊聊,点赞最高的下次专门出一期"科研代码debug实战"。
这是「科研人效率工具系列」第 34 期,上期:导师说论文Method部分像流水账?这套结构化写法让审稿人一眼看懂你的方法。下期预告:导师让你跟踪10个期刊的最新论文?用AI自动监控+摘要翻译,每天省1小时。
— 关注「科研创新社」,每天一个科研效率提升技巧 —