当前位置:首页>python>Python PDF 自动化保姆级③:提取 PDF 表格一键导出 Excel,职场最痛需求解决

Python PDF 自动化保姆级③:提取 PDF 表格一键导出 Excel,职场最痛需求解决

  • 2026-09-14 14:19:03
Python PDF 自动化保姆级③:提取 PDF 表格一键导出 Excel,职场最痛需求解决

这是整个系列最值得收藏的一篇。

如果说 PDF 文本提取是高频需求,那PDF 表格提取就是职场第一痛点。你一定经历过:财务发来一份 PDF 版的对账单,领导让你整理成 Excel。你对着 PDF 里的表格,一个格子一个格子地敲,敲完还要核对,几百行数据敲到手指抽筋。

今天用 pdfplumber 搞定它。从单表提取到多表批量,从简单表格到复杂合并单元格,全部覆盖。

01 为什么表格提取这么难

PDF 本质上是一种 "打印格式",它里面没有 "表格" 这个概念。你看到的表格,在 PDF 底层只是一堆线条和文字的位置排列。所以提取表格本质上是:识别线条位置 → 判断行列结构 → 把文字对应到单元格。

这也是为什么不同 PDF 的表格提取效果差异很大:

有线表格(有完整横竖线):最好提取,准确率 95% 以上。

无线表格(用空格或对齐模拟表格):较难,需要调参数。

合并单元格:结构复杂,需要额外处理。

跨页表格:一页断开,需要拼接。

pdfplumber 对有线表格支持最好,这也是职场最常见的类型。

02 基础提取:单页单表格

先从最简单的场景开始:一页 PDF 里只有一个表格。

import pdfplumberpdf_path = "financial_report.pdf"with pdfplumber.open(pdf_path) as pdf:    page = pdf.pages[0]  # 第一页    table = page.extract_table()    if table:        print(f"提取到 {len(table)} 行数据")        print("--- 前5行预览 ---")        for row in table[:5]:            print(row)    else:        print("未检测到表格")

extract_table() 返回一个二维列表(list of lists),每一行是一个子列表,每个元素是单元格内容。空单元格返回空字符串或 None。

注意:extract_table() 默认只提取页面上的第一个表格。如果一页有多个表格,要用 extract_tables()(复数)。

03 导出到 Excel

提取到二维列表后,用 pandas 导出 Excel:

import pdfplumberimport pandas as pdpdf_path = "financial_report.pdf"excel_path = "output.xlsx"with pdfplumber.open(pdf_path) as pdf:    page = pdf.pages[0]    table = page.extract_table()if table:    # 第一行作为表头    df = pd.DataFrame(table[1:], columns=table[0])    df.to_excel(excel_path, index=False)    print(f"已导出到: {excel_path}")    print(f"共 {len(df)} 行数据")else:    print("未检测到表格")
需要安装 pandas 和 openpyxl:
pip install pandas openpyxl

如果你的表格没有表头,直接全部作为数据:

df = pd.DataFrame(table)df.to_excel(excel_path, index=False, header=False)

04 一页多个表格

很多 PDF 一页上有好几个表格,用 extract_tables()(复数):

import pdfplumberimport pandas as pdwith pdfplumber.open("multi_tables.pdf") as pdf:    page = pdf.pages[0]    tables = page.extract_tables()    print(f"本页共检测到 {len(tables)} 个表格")    for i, table in enumerate(tables):        print(f"\n--- 表格 {i+1}:{len(table)} 行 ---")        for row in table[:3]:            print(row)

导出到同一个 Excel 的不同 Sheet:

import pdfplumberimport pandas as pdwith pdfplumber.open("multi_tables.pdf") as pdf:    page = pdf.pages[0]    tables = page.extract_tables()with pd.ExcelWriter("multi_output.xlsx") as writer:    for i, table in enumerate(tables):        if table:            df = pd.DataFrame(table[1:], columns=table[0])            df.to_excel(writer, sheet_name=f"表格{i+1}", index=False)print("多表格已导出到不同Sheet")

05 跨页表格:自动拼接

长表格经常跨页,每页都有表头。需要遍历所有页,跳过重复表头,拼接成一个完整表格:

import pdfplumberimport pandas as pdpdf_path = "long_table.pdf"all_rows = []header = Nonewith pdfplumber.open(pdf_path) as pdf:    for page_num, page in enumerate(pdf.pages):        table = page.extract_table()        if not table:            continue        if page_num == 0:            # 第一页:保存表头            header = table[0]            all_rows.extend(table[1:])        else:            # 后续页:跳过重复表头(第一行)            all_rows.extend(table[1:])        print(f"第 {page_num + 1} 页:已处理 {len(table)} 行")df = pd.DataFrame(all_rows, columns=header)df.to_excel("merged_table.xlsx", index=False)print(f"\n拼接完成!共 {len(df)} 行数据")print(f"已导出到: merged_table.xlsx")

注意: 这个方案假设每页的第一行都是表头。如果某些页没有重复表头,需要加判断逻辑(比如比较第一行是否和 header 相同)。

06 调参技巧:提取不准时怎么办

表格提取不准时,90% 的情况可以通过调参数解决。

table = page.extract_table(    table_settings={        "vertical_strategy": "lines",      # 垂直线识别策略        "horizontal_strategy": "lines",    # 水平线识别策略        "snap_tolerance": 3,                # 线条吸附容差        "join_tolerance": 3,                # 断线连接容差        "edge_min_length": 3,               # 最小线条长度    })

策略说明:

  • "lines":基于线条识别表格。有线表格用这个,默认值。
  • "text":基于文字位置识别表格。无线表格(用空格对齐的)用这个。
  • "lines_strict":严格基于线条,只认完整的边框线。

常见调参场景:

场景 1:无线表格(只有文字对齐)

table = page.extract_table(table_settings={    "vertical_strategy": "text",    "horizontal_strategy": "text",})

场景 2:线条断裂导致列数不对

table = page.extract_table(table_settings={    "join_tolerance": 10,  # 增大断线连接容差})

07 查看表格检测结果:调试神器

不知道为什么提取不准?用 find_tables() 查看 pdfplumber 检测到的表格结构:

import pdfplumberwith pdfplumber.open("problem.pdf") as pdf:    page = pdf.pages[0]    tables = page.find_tables()    for i, table in enumerate(tables):        print(f"表格 {i+1}:")        print(f"  行数: {len(table.rows)}")        print(f"  列数: {len(table.columns)}")        print(f"  列边界: {[round(c, 1) for c in table.cols]}")

这个方法能帮你看清 pdfplumber 识别出了几行几列、列边界在哪里,从而判断是线条没检测到还是列数分错了。

08 批量提取整个文件夹

终极需求:一个文件夹里全是带表格的 PDF,全部提取并导出 Excel。

import pdfplumberimport pandas as pdimport ospdf_dir = "./pdf_reports"output_dir = "./excel_output"os.makedirs(output_dir, exist_ok=True)pdf_files = [f for f in os.listdir(pdf_dir) if f.lower().endswith(".pdf")]for filename in pdf_files:    pdf_path = os.path.join(pdf_dir, filename)    excel_name = os.path.splitext(filename)[0] + ".xlsx"    excel_path = os.path.join(output_dir, excel_name)    try:        all_tables = []        with pdfplumber.open(pdf_path) as pdf:            for page in pdf.pages:                tables = page.extract_tables()                all_tables.extend(tables)        if all_tables:            # 合并所有表格(假设结构相同)            all_rows = []            header = None            for i, table in enumerate(all_tables):                if i == 0:                    header = table[0]                    all_rows.extend(table[1:])                else:                    all_rows.extend(table[1:])            df = pd.DataFrame(all_rows, columns=header)            df.to_excel(excel_path, index=False)            print(f"✓ {filename} → {excel_name} ({len(df)}行)")        else:            print(f"- {filename}:未检测到表格")    except Exception as e:        print(f"✗ {filename} 失败: {str(e)}")print("\n批量处理完成!")

09 常见坑与解决方案

坑 1:提取到的表格列数不对

大概率是线条没检测全。先用 find_tables() 看检测到的列边界,然后调 join_tolerance 或 snap_tolerance。如果是无线表格,切换到 "text" 策略。

坑 2:合并单元格内容错位

pdfplumber 对合并单元格的处理是:内容放在左上角单元格,其他合并区域的单元格为空。这是合理的,但如果你需要填充,可以后处理遍历表格补全。

坑 3:数字变成了字符串

PDF 提取出来的所有内容都是字符串。导出 Excel 后需要手动转换,或者用 pandas 的 pd.to_numeric() 自动转换:

for col in df.columns:    df[col] = pd.to_numeric(df[col], errors="ignore")

坑 4:扫描版 PDF 提取不到表格

扫描件是图片,没有文字层和线条信息,pdfplumber 无能为力。需要先 OCR 识别文字,再用视觉方案检测表格。可以考虑用百度智能云 / 腾讯云的表格识别 OCR API。

写在最后

PDF 表格提取是一个 "看起来简单,做起来全是坑" 的需求。pdfplumber 能解决 80% 的有线表格场景,剩下 20% 需要调参、后处理或换用 OCR 方案。

但即便只有 80%,也足以让你从 "手动敲表格" 的地狱中解放出来。一份 500 行的对账单,手动敲要 2 小时,Python 提取 + 核对只要 5 分钟。

最新文章

随机文章