这是整个系列最值得收藏的一篇。
如果说 PDF 文本提取是高频需求,那PDF 表格提取就是职场第一痛点。你一定经历过:财务发来一份 PDF 版的对账单,领导让你整理成 Excel。你对着 PDF 里的表格,一个格子一个格子地敲,敲完还要核对,几百行数据敲到手指抽筋。
今天用 pdfplumber 搞定它。从单表提取到多表批量,从简单表格到复杂合并单元格,全部覆盖。
01 为什么表格提取这么难
PDF 本质上是一种 "打印格式",它里面没有 "表格" 这个概念。你看到的表格,在 PDF 底层只是一堆线条和文字的位置排列。所以提取表格本质上是:识别线条位置 → 判断行列结构 → 把文字对应到单元格。
这也是为什么不同 PDF 的表格提取效果差异很大:
有线表格(有完整横竖线):最好提取,准确率 95% 以上。
无线表格(用空格或对齐模拟表格):较难,需要调参数。
合并单元格:结构复杂,需要额外处理。
跨页表格:一页断开,需要拼接。
pdfplumber 对有线表格支持最好,这也是职场最常见的类型。
02 基础提取:单页单表格
先从最简单的场景开始:一页 PDF 里只有一个表格。
import pdfplumberpdf_path = "financial_report.pdf"with pdfplumber.open(pdf_path) as pdf: page = pdf.pages[0] # 第一页 table = page.extract_table() if table: print(f"提取到 {len(table)} 行数据") print("--- 前5行预览 ---") for row in table[:5]: print(row) else: print("未检测到表格")
extract_table() 返回一个二维列表(list of lists),每一行是一个子列表,每个元素是单元格内容。空单元格返回空字符串或 None。
注意:extract_table() 默认只提取页面上的第一个表格。如果一页有多个表格,要用 extract_tables()(复数)。
03 导出到 Excel
提取到二维列表后,用 pandas 导出 Excel:
import pdfplumberimport pandas as pdpdf_path = "financial_report.pdf"excel_path = "output.xlsx"with pdfplumber.open(pdf_path) as pdf: page = pdf.pages[0] table = page.extract_table()if table: # 第一行作为表头 df = pd.DataFrame(table[1:], columns=table[0]) df.to_excel(excel_path, index=False) print(f"已导出到: {excel_path}") print(f"共 {len(df)} 行数据")else: print("未检测到表格")
需要安装 pandas 和 openpyxl:
pip install pandas openpyxl
如果你的表格没有表头,直接全部作为数据:
df = pd.DataFrame(table)df.to_excel(excel_path, index=False, header=False)
04 一页多个表格
很多 PDF 一页上有好几个表格,用 extract_tables()(复数):
import pdfplumberimport pandas as pdwith pdfplumber.open("multi_tables.pdf") as pdf: page = pdf.pages[0] tables = page.extract_tables() print(f"本页共检测到 {len(tables)} 个表格") for i, table in enumerate(tables): print(f"\n--- 表格 {i+1}:{len(table)} 行 ---") for row in table[:3]: print(row)
导出到同一个 Excel 的不同 Sheet:
import pdfplumberimport pandas as pdwith pdfplumber.open("multi_tables.pdf") as pdf: page = pdf.pages[0] tables = page.extract_tables()with pd.ExcelWriter("multi_output.xlsx") as writer: for i, table in enumerate(tables): if table: df = pd.DataFrame(table[1:], columns=table[0]) df.to_excel(writer, sheet_name=f"表格{i+1}", index=False)print("多表格已导出到不同Sheet")
05 跨页表格:自动拼接
长表格经常跨页,每页都有表头。需要遍历所有页,跳过重复表头,拼接成一个完整表格:
import pdfplumberimport pandas as pdpdf_path = "long_table.pdf"all_rows = []header = Nonewith pdfplumber.open(pdf_path) as pdf: for page_num, page in enumerate(pdf.pages): table = page.extract_table() if not table: continue if page_num == 0: # 第一页:保存表头 header = table[0] all_rows.extend(table[1:]) else: # 后续页:跳过重复表头(第一行) all_rows.extend(table[1:]) print(f"第 {page_num + 1} 页:已处理 {len(table)} 行")df = pd.DataFrame(all_rows, columns=header)df.to_excel("merged_table.xlsx", index=False)print(f"\n拼接完成!共 {len(df)} 行数据")print(f"已导出到: merged_table.xlsx")
注意: 这个方案假设每页的第一行都是表头。如果某些页没有重复表头,需要加判断逻辑(比如比较第一行是否和 header 相同)。
06 调参技巧:提取不准时怎么办
表格提取不准时,90% 的情况可以通过调参数解决。
table = page.extract_table( table_settings={ "vertical_strategy": "lines", # 垂直线识别策略 "horizontal_strategy": "lines", # 水平线识别策略 "snap_tolerance": 3, # 线条吸附容差 "join_tolerance": 3, # 断线连接容差 "edge_min_length": 3, # 最小线条长度 })
策略说明:
"lines":基于线条识别表格。有线表格用这个,默认值。"text":基于文字位置识别表格。无线表格(用空格对齐的)用这个。"lines_strict":严格基于线条,只认完整的边框线。
常见调参场景:
场景 1:无线表格(只有文字对齐)
table = page.extract_table(table_settings={ "vertical_strategy": "text", "horizontal_strategy": "text",})
场景 2:线条断裂导致列数不对
table = page.extract_table(table_settings={ "join_tolerance": 10, # 增大断线连接容差})
07 查看表格检测结果:调试神器
不知道为什么提取不准?用 find_tables() 查看 pdfplumber 检测到的表格结构:
import pdfplumberwith pdfplumber.open("problem.pdf") as pdf: page = pdf.pages[0] tables = page.find_tables() for i, table in enumerate(tables): print(f"表格 {i+1}:") print(f" 行数: {len(table.rows)}") print(f" 列数: {len(table.columns)}") print(f" 列边界: {[round(c, 1) for c in table.cols]}")
这个方法能帮你看清 pdfplumber 识别出了几行几列、列边界在哪里,从而判断是线条没检测到还是列数分错了。
08 批量提取整个文件夹
终极需求:一个文件夹里全是带表格的 PDF,全部提取并导出 Excel。
import pdfplumberimport pandas as pdimport ospdf_dir = "./pdf_reports"output_dir = "./excel_output"os.makedirs(output_dir, exist_ok=True)pdf_files = [f for f in os.listdir(pdf_dir) if f.lower().endswith(".pdf")]for filename in pdf_files: pdf_path = os.path.join(pdf_dir, filename) excel_name = os.path.splitext(filename)[0] + ".xlsx" excel_path = os.path.join(output_dir, excel_name) try: all_tables = [] with pdfplumber.open(pdf_path) as pdf: for page in pdf.pages: tables = page.extract_tables() all_tables.extend(tables) if all_tables: # 合并所有表格(假设结构相同) all_rows = [] header = None for i, table in enumerate(all_tables): if i == 0: header = table[0] all_rows.extend(table[1:]) else: all_rows.extend(table[1:]) df = pd.DataFrame(all_rows, columns=header) df.to_excel(excel_path, index=False) print(f"✓ {filename} → {excel_name} ({len(df)}行)") else: print(f"- {filename}:未检测到表格") except Exception as e: print(f"✗ {filename} 失败: {str(e)}")print("\n批量处理完成!")
09 常见坑与解决方案
坑 1:提取到的表格列数不对
大概率是线条没检测全。先用 find_tables() 看检测到的列边界,然后调 join_tolerance 或 snap_tolerance。如果是无线表格,切换到 "text" 策略。
坑 2:合并单元格内容错位
pdfplumber 对合并单元格的处理是:内容放在左上角单元格,其他合并区域的单元格为空。这是合理的,但如果你需要填充,可以后处理遍历表格补全。
坑 3:数字变成了字符串
PDF 提取出来的所有内容都是字符串。导出 Excel 后需要手动转换,或者用 pandas 的 pd.to_numeric() 自动转换:
for col in df.columns: df[col] = pd.to_numeric(df[col], errors="ignore")
坑 4:扫描版 PDF 提取不到表格
扫描件是图片,没有文字层和线条信息,pdfplumber 无能为力。需要先 OCR 识别文字,再用视觉方案检测表格。可以考虑用百度智能云 / 腾讯云的表格识别 OCR API。
写在最后
PDF 表格提取是一个 "看起来简单,做起来全是坑" 的需求。pdfplumber 能解决 80% 的有线表格场景,剩下 20% 需要调参、后处理或换用 OCR 方案。
但即便只有 80%,也足以让你从 "手动敲表格" 的地狱中解放出来。一份 500 行的对账单,手动敲要 2 小时,Python 提取 + 核对只要 5 分钟。