月底最烦的事,是不是它
你是不是也这样:每个月月底,微信里哗啦啦发来一堆 PDF 发票,有滴滴的、有吃饭的、有买办公用品的。老板一句"把这些录进 Excel 表里",你就得一张张打开、眯着眼找发票号、找金额、手动敲进去。
几十张还能忍,要是上百张,半天就交代在复制粘贴上了,而且越到后面越容易看串行、录错数。更糟的是,录完还得再核对一遍,确保没漏没重。
其实这种"重复、机械、规则固定"的活儿,恰恰最适合交给 Python。今天我们就用不到 50 行代码,让电脑自动把一文件夹 PDF 发票,汇总成一张规整的 Excel 表。你只需要把发票丢进文件夹,双击一跑,去倒杯水的功夫,表就出来了。
你可能会嘀咕,我零基础也行吗?放心,今天这段代码不用你每行都搞懂,照着放进去就能跑,跑通了再回头慢慢琢磨,成就感先拿到手。
先说思路,别被吓到
整个流程就四步,特别好懂:第一步,让 Python 把 invoices 文件夹里的 PDF 全部列出来;第二步,用 pdfplumber 这个库把每张 PDF 里的文字"读"出来;第三步,用正则表达式(就是一套按模式找文字的规则)从里面抠出发票号、开票日期、销售方、金额、税额;第四步,用 openpyxl 把这些字段一行行写进 Excel。
为啥选这两个库?pdfplumber 对中文发票的排版识别很稳,连表格都能抽;openpyxl 是专门读写 .xlsx 的,不用装庞大的 Excel 软件。两个都是一行命令就能装好,对新手特别友好。
第一步:装库、建文件夹
打开终端(Mac 叫终端,Windows 叫命令提示符或 PowerShell),先装库:
pip install pdfplumber openpyxl
装好后,在随便一个目录里新建一个文件夹,名字叫 invoices,把要处理的 PDF 发票全部丢进去。再在这个目录里新建一个文件,叫 invoice_extract.py,咱们待会儿把代码写进去。
小提醒:路径里最好不要有中文和空格,能少踩很多坑。比如 D:\work\invoices 就挺好,脚本也放这个目录里。
第二步:先抽一张,看看能读出啥
在动手批量处理之前,咱们先拿一张发票试水,确认 Python 真能读出来。把下面这段代码单独跑一下:
import pdfplumber
path = "invoices/第一张发票.pdf"
with pdfplumber.open(path) as pdf:
text = "\n".join(page.extract_text() or "" for page in pdf.pages)
print(text)
跑完之后,终端会打印出一整段文字,里面应该有"发票号码""开票日期""价税合计"这些字眼。如果你看到的是一堆乱码或者空白,那这张发票很可能是"扫描件"(图片做的 PDF),这种情况我在后面常见问题里再教你怎么办。
只要能打印出文字,就说明路通了,接下来就是从这堆文字里把想要的字段挑出来。别急着一次性写完美,先跑通最小的一步,信心就来了。
第三步:用正则把关键信息抠出来
PDF 读出来的文字是一大段字符串,我们要从中精准找到"发票号码""金额"这些位置。这里用正则表达式最合适——别被名字吓到,它就是一套"按模式匹配文字"的规则,写几次就熟了。
import re
def extract_fields(text):
f = {"发票号码": "", "开票日期": "", "销售方": "", "价税合计": "", "税额": ""}
m = re.search(r"发票号码[::]?\s*([0-9]{8,20})", text)
if m:
f["发票号码"] = m.group(1)
m = re.search(r"开票日期[::]?\s*(\d{4}[-年/]\d{1,2}[-月/]\d{1,2})", text)
if m:
f["开票日期"] = m.group(1)
m = re.search(r"销售方(?:名称)?[::]\s*([^\n]{2,30})", text)
if m:
f["销售方"] = m.group(1).strip()
m = re.search(r"价税合计[^\d]*([0-9][0-9,]*\.?\d*)", text)
if m:
f["价税合计"] = m.group(1)
m = re.search(r"税额[^\d]*([0-9][0-9,]*\.?\d*)", text)
if m:
f["税额"] = m.group(1)
return f
简单解释下:re.search 会在文字里找第一个符合规则的位置;r"发票号码[::]?\s*([0-9]{8,20})" 的意思是——先找"发票号码"这四个字,后面可能跟个冒号(中英文都认),再后面跟着 8 到 20 位数字,把那串数字抓出来。
注意 ([0-9]{8,20}) 外面那对括号,它表示"我要的就是要这一小段",抓出来放在 m.group(1) 里。其它几个字段同理,都是"找关键词 + 抓后面的内容",看懂一个就会全部。
第四步:批量跑,自动生成 Excel
单张搞定了,批量就是在外面套个循环。下面是完整脚本,直接整段复制到 invoice_extract.py 里就能跑:
import os
import re
import glob
import pdfplumber
from openpyxl import Workbook, load_workbook
PDF_DIR = "invoices"
OUTPUT = "发票汇总.xlsx"
def find_invoices(folder):
return sorted(glob.glob(os.path.join(folder, "*.pdf")))
def extract_fields(text):
f = {"发票号码": "", "开票日期": "", "销售方": "", "价税合计": "", "税额": ""}
m = re.search(r"发票号码[::]?\s*([0-9]{8,20})", text)
if m:
f["发票号码"] = m.group(1)
m = re.search(r"开票日期[::]?\s*(\d{4}[-年/]\d{1,2}[-月/]\d{1,2})", text)
if m:
f["开票日期"] = m.group(1)
m = re.search(r"销售方(?:名称)?[::]\s*([^\n]{2,30})", text)
if m:
f["销售方"] = m.group(1).strip()
m = re.search(r"价税合计[^\d]*([0-9][0-9,]*\.?\d*)", text)
if m:
f["价税合计"] = m.group(1)
m = re.search(r"税额[^\d]*([0-9][0-9,]*\.?\d*)", text)
if m:
f["税额"] = m.group(1)
return f
def main():
files = find_invoices(PDF_DIR)
if not files:
print("没找到 PDF,把发票放进 invoices 文件夹再试~")
return
if os.path.exists(OUTPUT):
wb = load_workbook(OUTPUT)
ws = wb.active
else:
wb = Workbook()
ws = wb.active
ws.append(["发票号码", "开票日期", "销售方", "价税合计", "税额", "文件名"])
for path in files:
with pdfplumber.open(path) as pdf:
text = "\n".join((p.extract_text() or "") for p in pdf.pages)
f = extract_fields(text)
f["文件名"] = os.path.basename(path)
ws.append([f["发票号码"], f["开票日期"], f["销售方"],
f["价税合计"], f["税额"], f["文件名"]])
print("已处理:", f["文件名"], "->", f["发票号码"] or "(未识别)")
wb.save(OUTPUT)
print(f"搞定!共处理 {len(files)} 张,结果在 {OUTPUT}")
if __name__ == "__main__":
main()
跑之前确认 invoices 文件夹和这个脚本在同一目录,然后在终端执行 python invoice_extract.py。你会看到一张张发票被处理的信息刷出来,最后蹦出一句"搞定"。脚本很聪明:第一次跑会新建 Excel 并写表头,之后再跑会接着往里追加,不会把之前的结果冲掉。
第五步:打开 Excel 验收
脚本跑完,同目录下会多出一个 发票汇总.xlsx。双击打开,里面应该是一张干干净净的表:第一行是表头,下面每一行对应一张发票,发票号、日期、销售方、金额、税额、文件名,整整齐齐排好。
你扫一眼,如果某张发票的"发票号码"或"金额"是空的,说明那张发票的排版比较特殊,规则没匹配上——别急,下一节我就说怎么调,不难。
常见坑:为什么我的字段抓不出来
第一,最常见的是扫描件。有些 PDF 看着像发票,其实是把图片塞进了 PDF,里面根本没有"文字",pdfplumber 自然读不出东西。这种得用 OCR(光学字符识别)先把图片转成文字,比如 pytesseract 这个库。要不要专门写一期 OCR 识别发票,你可以告诉我。
第二,不同发票模板长不一样。滴滴的、税务局的、各家公司的,字段位置千差万别。规则是对着一种模板写的,换一种就可能抓偏。解决办法很简单:先单独 print(text) 看那张发票的文字长啥样,再把正则里对应的关键词改一改就行,不用推倒重来。
第三,金额抓到了奇怪的数字。因为发票上数字很多,"价税合计"后面如果还跟着别的数字,可能误抓。遇到这种情况,把正则写得更精确一点,比如限定只抓带小数点的、或者带"¥"符号的,就能更准。
第四,路径里有中文或空格,偶尔会出幺蛾子。把文件夹名改成英文最省心,也方便以后发给同事。
还能怎么升级
跑通之后,你可以顺着这个思路继续加功能,让它更"聪明":比如按发票号码去重,同一张别录两遍;按销售方分 sheet,一眼看清每家花了多少;或者处理完自动发邮件把表甩给会计;再进阶一点,用之前聊过的定时任务,让它在每天凌晨自动跑一遍,你早上来直接看结果。
你看,这不就是把之前学的 Python 文件操作、正则、还有 Excel 那套,串成了一个真正能帮你省时间的工具。编程最爽的时刻,就是看自己写的几十行代码,把原本要熬半天的活儿,几秒钟干完。
小结
发票录入这种活儿,重复、枯燥、还容易错,本来就不该让人干。今天咱们用 pdfplumber 读文字、正则抠字段、openpyxl 写 Excel,不到 50 行就搞定了批量汇总。
你手头要正有一堆发票等着录,现在就可以照着敲一遍。跑通的那一刻,你会真切地感觉到:编程不是考试题,是能替你扛活的帮手。要是卡在哪一步,把报错发给我,咱们一起排。