前面五篇覆盖了 PDF 的基础操作、文本提取、表格提取、加密水印和生成报告。今天进入第六个高频场景:格式转换。
职场中格式转换的需求无处不在:Word 文档要转 PDF 发给客户、Excel 报表要转 PDF 打印、PDF 要转成图片插入 PPT、几十份文件要批量转换…… 一个个打开另存为,效率太低。
01 Word 转 PDF:两种方案对比
Python 将 Word 转 PDF 主要有两种方案,各有适用场景:
方案一:pywin32(Windows 专用,效果最好)
调用本机 Microsoft Word 的 COM 接口,用 Word 本身打开文档再另存为 PDF。优点是转换效果 100% 还原,格式、字体、图表都不会乱。缺点是只能在 Windows 上用,且必须安装 Microsoft Word。
方案二:libreoffice(跨平台,效果较好)
调用 LibreOffice 的命令行工具转换。优点是跨平台(Windows/Mac/Linux 都能用),不需要安装 Microsoft Office。缺点是复杂格式的还原度略低于 Word 原生转换。
02 方案一:pywin32 调用 Word 转换
先安装 pywin32:
单文件转换:
import win32com.clientimport osdef word_to_pdf(word_path, pdf_path): # 启动Word应用 word = win32com.client.Dispatch("Word.Application") word.Visible = False # 后台运行,不显示界面 try: # 打开文档 doc = word.Documents.Open(os.path.abspath(word_path)) # 另存为PDF(17是PDF格式代码) doc.SaveAs(os.path.abspath(pdf_path), FileFormat=17) doc.Close() print(f"转换成功: {word_path} → {pdf_path}") except Exception as e: print(f"转换失败: {word_path}, 错误: {str(e)}") finally: word.Quit()word_to_pdf("document.docx", "document.pdf")
批量转换整个文件夹:
import win32com.clientimport osdef batch_word_to_pdf(input_dir, output_dir): os.makedirs(output_dir, exist_ok=True) word = win32com.client.Dispatch("Word.Application") word.Visible = False # 获取所有Word文件 word_files = [f for f in os.listdir(input_dir) if f.lower().endswith((".doc", ".docx"))] success = 0 fail = 0 for filename in word_files: input_path = os.path.join(input_dir, filename) pdf_name = os.path.splitext(filename)[0] + ".pdf" output_path = os.path.join(output_dir, pdf_name) try: doc = word.Documents.Open(os.path.abspath(input_path)) doc.SaveAs(os.path.abspath(output_path), FileFormat=17) doc.Close() print(f"✓ {filename} → {pdf_name}") success += 1 except Exception as e: print(f"✗ {filename} 失败: {str(e)}") fail += 1 word.Quit() print(f"\n完成!成功 {success} 个,失败 {fail} 个")batch_word_to_pdf("./word_files", "./pdf_output")
关键说明:
- 必须用
os.path.abspath() 转换为绝对路径,Word 的 COM 接口不支持相对路径。 FileFormat=17 是 PDF 格式的代码,这是 Word 的常量值。- 批量转换时只启动一次 Word 实例,循环处理所有文件,最后再 Quit,比每次启动关闭快很多。
03 方案二:LibreOffice 跨平台转换
先安装 LibreOffice(官网下载免费安装),确保命令行可用。
Windows 安装后,soffice.exe 通常在C:\Program Files\LibreOffice\program\soffice.exe。
单文件转换:
import subprocessimport osdef word_to_pdf_libreoffice(word_path, output_dir): # LibreOffice可执行文件路径(根据实际安装位置调整) soffice = "C:/Program Files/LibreOffice/program/soffice.exe" # Mac: /Applications/LibreOffice.app/Contents/MacOS/soffice # Linux: soffice cmd = [ soffice, "--headless", # 无头模式,不显示界面 "--convert-to", "pdf", "--outdir", output_dir, word_path ] result = subprocess.run(cmd, capture_output=True, text=True) if result.returncode == 0: print(f"转换成功: {word_path}") else: print(f"转换失败: {result.stderr}")word_to_pdf_libreoffice("document.docx", "./pdf_output")
批量转换:
import subprocessimport osdef batch_convert_libreoffice(input_dir, output_dir): os.makedirs(output_dir, exist_ok=True) soffice = "C:/Program Files/LibreOffice/program/soffice.exe" files = [f for f in os.listdir(input_dir) if f.lower().endswith((".doc", ".docx", ".xls", ".xlsx"))] for filename in files: filepath = os.path.join(input_dir, filename) cmd = [soffice, "--headless", "--convert-to", "pdf", "--outdir", output_dir, filepath] result = subprocess.run(cmd, capture_output=True, text=True) if result.returncode == 0: print(f"✓ {filename}") else: print(f"✗ {filename}: {result.stderr.strip()}")batch_convert_libreoffice("./office_files", "./pdf_output")
LibreOffice 的好处是一个命令搞定 Word 和 Excel 转 PDF,不需要分开写代码。
04 Excel 转 PDF
方案一:pywin32 调用 Excel(Windows,效果最好)
import win32com.clientimport osdef excel_to_pdf(excel_path, pdf_path): excel = win32com.client.Dispatch("Excel.Application") excel.Visible = False excel.DisplayAlerts = False # 禁用弹窗提示 try: wb = excel.Workbooks.Open(os.path.abspath(excel_path)) # 0是PDF格式 wb.ExportAsFixedFormat(0, os.path.abspath(pdf_path)) wb.Close() print(f"转换成功: {excel_path} → {pdf_path}") except Exception as e: print(f"转换失败: {str(e)}") finally: excel.Quit()excel_to_pdf("report.xlsx", "report.pdf")
批量转换:
import win32com.clientimport osdef batch_excel_to_pdf(input_dir, output_dir): os.makedirs(output_dir, exist_ok=True) excel = win32com.client.Dispatch("Excel.Application") excel.Visible = False excel.DisplayAlerts = False excel_files = [f for f in os.listdir(input_dir) if f.lower().endswith((".xls", ".xlsx"))] for filename in excel_files: input_path = os.path.join(input_dir, filename) pdf_name = os.path.splitext(filename)[0] + ".pdf" output_path = os.path.join(output_dir, pdf_name) try: wb = excel.Workbooks.Open(os.path.abspath(input_path)) wb.ExportAsFixedFormat(0, os.path.abspath(output_path)) wb.Close() print(f"✓ {filename} → {pdf_name}") except Exception as e: print(f"✗ {filename} 失败: {str(e)}") excel.Quit() print("\n批量转换完成!")batch_excel_to_pdf("./excel_files", "./pdf_output")
Excel 转 PDF 的常见问题:
- 内容被截断:Excel 列太多,转 PDF 后右边被切掉。解决方法:在 Excel 中设置 "将所有列调整为一页":
# 设置所有列适应一页宽for ws in wb.Worksheets: ws.PageSetup.Zoom = False ws.PageSetup.FitToPagesWide = 1 ws.PageSetup.FitToPagesTall = False # 高度不限制
- 只转换了第一个 Sheet:
ExportAsFixedFormat 默认转换所有 Sheet。如果只想转特定 Sheet,需要先选中:wb.Sheets("Sheet1").ExportAsFixedFormat(0, pdf_path)。 - 打印区域问题:如果 Excel 设置了打印区域,只会转换打印区域内的内容。可以用
ws.PageSetup.PrintArea = "" 清除打印区域。
05 PDF 转图片
PDF 转图片常用两个库:pdf2image(基于 poppler,效果好)和PyMuPDF(fitz)(轻量,速度快)。
方案一:pdf2image(推荐,效果好)
pdf2image 依赖 poppler,需要先安装:
- Windows:下载 poppler-windows,解压后把 bin 目录加入 PATH
- Linux:
sudo apt install poppler-utils
pip install pdf2image
单文件转换(全部页):
from pdf2image import convert_from_pathimport osdef pdf_to_images(pdf_path, output_dir, dpi=200): os.makedirs(output_dir, exist_ok=True) # Windows需要指定poppler路径 # poppler_path = "C:/poppler-xx.x.x/bin" # images = convert_from_path(pdf_path, dpi=dpi, poppler_path=poppler_path) images = convert_from_path(pdf_path, dpi=dpi) for i, img in enumerate(images, start=1): output_path = os.path.join(output_dir, f"page_{i:03d}.png") img.save(output_path, "PNG") print(f"已保存: {output_path}") print(f"转换完成!共 {len(images)} 页")pdf_to_images("document.pdf", "./images")
只转换指定页:
from pdf2image import convert_from_path# 只转第1到第3页images = convert_from_path("document.pdf", dpi=200, first_page=1, last_page=3)
方案二:PyMuPDF(fitz,轻量快速)
pip install pymupdfimport fitz # PyMuPDFimport osdef pdf_to_images_fitz(pdf_path, output_dir, dpi=200): os.makedirs(output_dir, exist_ok=True) doc = fitz.open(pdf_path) # 计算缩放比例(默认72dpi,目标dpi需要缩放) zoom = dpi / 72 mat = fitz.Matrix(zoom, zoom) for page_num in range(len(doc)): page = doc[page_num] pix = page.get_pixmap(matrix=mat) output_path = os.path.join(output_dir, f"page_{page_num + 1:03d}.png") pix.save(output_path) print(f"已保存: {output_path}") doc.close() print(f"转换完成!共 {len(doc)} 页")pdf_to_images_fitz("document.pdf", "./images")
两种方案对比:
- pdf2image:渲染效果更好,对复杂 PDF 兼容性好,但需要安装 poppler 依赖。
- PyMuPDF:纯 Python 包(pip 安装即可,无外部依赖),速度快,内存占用低,渲染效果略逊于 pdf2image 但日常够用。
批量 PDF 转图片:
import fitzimport osdef batch_pdf_to_images(input_dir, output_root, dpi=200): pdf_files = [f for f in os.listdir(input_dir) if f.lower().endswith(".pdf")] zoom = dpi / 72 mat = fitz.Matrix(zoom, zoom) for filename in pdf_files: pdf_path = os.path.join(input_dir, filename) # 每个PDF创建单独的文件夹 folder_name = os.path.splitext(filename)[0] output_dir = os.path.join(output_root, folder_name) os.makedirs(output_dir, exist_ok=True) try: doc = fitz.open(pdf_path) for page_num in range(len(doc)): page = doc[page_num] pix = page.get_pixmap(matrix=mat) output_path = os.path.join(output_dir, f"page_{page_num + 1:03d}.png") pix.save(output_path) doc.close() print(f"✓ {filename} → {len(doc)}页") except Exception as e: print(f"✗ {filename} 失败: {str(e)}")batch_pdf_to_images("./pdf_files", "./images_output")
06 常见坑与解决方案
坑 1:pywin32 转换时 Word/Excel 弹出对话框卡住
常见原因:文档有修复提示、宏警告、兼容性提示。解决方法:1)确保源文件正常;2)设置 DisplayAlerts = False(Excel);3)Word 可以用 word.DisplayAlerts = 0。
坑 2:pywin32 转换后进程残留
如果脚本异常退出,Word/Excel 进程可能残留在后台。用任务管理器手动结束 WINWORD.EXE 或 EXCEL.EXE 进程。代码中一定要用 try-finally 确保 Quit 被调用。
坑 3:LibreOffice 转换中文乱码
确保系统安装了中文字体。Linux 下安装文泉驿字体:sudo apt install fonts-wqy-zenhei fonts-wqy-microhei。
坑 4:pdf2image 报错 "Unable to get page count"
poppler 没安装或路径不对。Windows 用户必须指定 poppler_path 参数,指向 poppler 的 bin 目录。或者改用 PyMuPDF,无外部依赖。
坑 5:PDF 转图片后文字模糊
提高 DPI。默认可能是 150dpi,打印质量建议 300dpi,屏幕查看 200dpi 足够。DPI 越高图片越清晰,但文件越大、转换越慢。
写在最后
格式转换是 PDF 自动化中非常实用的一环。Word/Excel 转 PDF 适合用 pywin32(Windows)或 LibreOffice(跨平台),PDF 转图片推荐 PyMuPDF(轻量无依赖)或 pdf2image(效果好)。掌握这些,你就能批量处理几十上百份文件的格式转换,再也不用一个个打开另存为了。