前面三篇搞定了 PDF 的基础操作、文本提取和表格提取。今天进入第四个高频场景:安全与水印。
职场中你一定遇到过:收到的 PDF 有密码打不开、需要给合同加水印防止泄露、批量给文件加密、忘记 PDF 密码…… 这些操作用 Adobe Acrobat 一个个弄,费时费力还容易出错。
今天用 Python 一次性搞定:加密、解密、去密码、加水印、去水印,全部支持批量。
01 PDF 加密:给文件加密码
PDF 支持两种密码:
用户密码(user password):打开文件时需要输入的密码。不知道密码连看都看不到。
所有者密码(owner password):控制权限的密码。可以打开文件,但限制打印、复制、编辑等操作。
用 PyPDF2 加密非常简单:
from PyPDF2 import PdfReader, PdfWriterinput_pdf = "document.pdf"output_pdf = "encrypted.pdf"user_password = "123456" # 打开密码owner_password = "admin888" # 权限密码reader = PdfReader(input_pdf)writer = PdfWriter()for page in reader.pages: writer.add_page(page)# 加密writer.encrypt( user_password=user_password, owner_password=owner_password, use_128bit=True # 使用128位加密)with open(output_pdf, "wb") as f: writer.write(f)print(f"加密完成!输出文件: {output_pdf}")print(f"打开密码: {user_password}")
关键说明:
use_128bit=True 使用 128 位 AES 加密,安全性较高。如果需要兼容老版本 PDF 阅读器,可以设为 False 使用 40 位 RC4 加密。- 只设 user_password 不设 owner_password 时,两者会使用同一个密码。
- 加密后的文件无法再用 PyPDF2 直接操作,需要先解密。
02 批量加密整个文件夹
from PyPDF2 import PdfReader, PdfWriterimport ospdf_dir = "./to_encrypt"output_dir = "./encrypted"password = "your_password"os.makedirs(output_dir, exist_ok=True)pdf_files = [f for f in os.listdir(pdf_dir) if f.lower().endswith(".pdf")]for filename in pdf_files: input_path = os.path.join(pdf_dir, filename) output_path = os.path.join(output_dir, filename) try: reader = PdfReader(input_path) writer = PdfWriter() for page in reader.pages: writer.add_page(page) writer.encrypt(user_password=password) with open(output_path, "wb") as f: writer.write(f) print(f"✓ {filename} 加密成功") except Exception as e: print(f"✗ {filename} 失败: {str(e)}")print("\n批量加密完成!")
03 PDF 解密:去除密码
知道密码的情况下,去除密码非常简单:
from PyPDF2 import PdfReader, PdfWriterinput_pdf = "encrypted.pdf"output_pdf = "decrypted.pdf"password = "123456"reader = PdfReader(input_pdf)# 检查是否加密if reader.is_encrypted: reader.decrypt(password) print("密码验证成功,正在解密...")else: print("该PDF未加密,无需解密")writer = PdfWriter()for page in reader.pages: writer.add_page(page)with open(output_pdf, "wb") as f: writer.write(f)print(f"解密完成!输出文件: {output_pdf}")
注意: 这里说的 "解密" 是指知道密码的情况下去除密码保护,不是暴力破解。暴力破解 PDF 密码在法律和道德上都有问题,本文不涉及。
04 批量解密:知道密码一键去除
from PyPDF2 import PdfReader, PdfWriterimport ospdf_dir = "./encrypted_files"output_dir = "./decrypted_files"password = "your_password"os.makedirs(output_dir, exist_ok=True)pdf_files = [f for f in os.listdir(pdf_dir) if f.lower().endswith(".pdf")]for filename in pdf_files: input_path = os.path.join(pdf_dir, filename) output_path = os.path.join(output_dir, filename) try: reader = PdfReader(input_path) if reader.is_encrypted: reader.decrypt(password) writer = PdfWriter() for page in reader.pages: writer.add_page(page) with open(output_path, "wb") as f: writer.write(f) print(f"✓ {filename} 解密成功") except Exception as e: print(f"✗ {filename} 失败: {str(e)}")print("\n批量解密完成!")
05 加水印:给 PDF 加上文字水印
水印是职场保护文档的常用手段。方案是:先用 reportlab 生成一个透明背景的水印 PDF,再用 PyPDF2 把水印叠加到每一页上。
第一步:生成水印 PDF
from reportlab.pdfgen import canvasfrom reportlab.lib.pagesizes import A4from reportlab.lib.colors import Colordef create_watermark(text, output="watermark.pdf"): c = canvas.Canvas(output, pagesize=A4) width, height = A4 # 设置字体和大小 c.setFont("Helvetica", 50) # 设置颜色和透明度(灰色,30%不透明度) c.setFillColor(Color(0.5, 0.5, 0.5, alpha=0.3)) # 旋转45度 c.saveState() c.translate(width / 2, height / 2) c.rotate(45) # 绘制多行水印,覆盖整页 for y in range(-300, 400, 150): for x in range(-400, 500, 300): c.drawString(x, y, text) c.restoreState() c.save() print(f"水印PDF已生成: {output}")create_watermark("CONFIDENTIAL 机密文件")
第二步:把水印叠加到 PDF 每一页
from PyPDF2 import PdfReader, PdfWriterinput_pdf = "document.pdf"watermark_pdf = "watermark.pdf"output_pdf = "watermarked.pdf"# 读取水印页watermark_reader = PdfReader(watermark_pdf)watermark_page = watermark_reader.pages[0]reader = PdfReader(input_pdf)writer = PdfWriter()for page in reader.pages: # 把水印合并到当前页 page.merge_page(watermark_page) writer.add_page(page)with open(output_pdf, "wb") as f: writer.write(f)print(f"水印添加完成!输出文件: {output_pdf}")
中文水印处理: reportlab 默认不支持中文字体,需要注册中文字体。Windows 下可以用系统字体:
from reportlab.pdfgen import canvasfrom reportlab.lib.pagesizes import A4from reportlab.lib.colors import Colorfrom reportlab.pdfbase import pdfmetricsfrom reportlab.pdfbase.ttfonts import TTFont# 注册中文字体(Windows示例)pdfmetrics.registerFont(TTFont("SimSun", "C:/Windows/Fonts/simsun.ttc"))def create_watermark_cn(text, output="watermark_cn.pdf"): c = canvas.Canvas(output, pagesize=A4) width, height = A4 c.setFont("SimSun", 40) c.setFillColor(Color(0.5, 0.5, 0.5, alpha=0.3)) c.saveState() c.translate(width / 2, height / 2) c.rotate(45) for y in range(-300, 400, 150): for x in range(-400, 500, 300): c.drawString(x, y, text) c.restoreState() c.save()create_watermark_cn("内部资料 请勿外传")
06 批量加水印
from PyPDF2 import PdfReader, PdfWriterimport ospdf_dir = "./to_watermark"output_dir = "./watermarked"watermark_pdf = "watermark.pdf"os.makedirs(output_dir, exist_ok=True)watermark_page = PdfReader(watermark_pdf).pages[0]pdf_files = [f for f in os.listdir(pdf_dir) if f.lower().endswith(".pdf")]for filename in pdf_files: input_path = os.path.join(pdf_dir, filename) output_path = os.path.join(output_dir, filename) try: reader = PdfReader(input_path) writer = PdfWriter() for page in reader.pages: page.merge_page(watermark_page) writer.add_page(page) with open(output_path, "wb") as f: writer.write(f) print(f"✓ {filename} 加水印成功") except Exception as e: print(f"✗ {filename} 失败: {str(e)}")print("\n批量加水印完成!")
07 去水印:能去掉吗?
先说结论:完美去水印几乎不可能。
原因:水印一旦通过 merge_page 叠加到 PDF 页面上,就和原页面内容融为一体了,无法区分哪些是水印、哪些是原文。就像在一张纸上盖了章,你没法把章的墨迹单独去掉。
但有几种特殊情况可以处理:
情况 1:水印是独立的注释层(Annotation)
有些 PDF 的水印是作为注释添加的,可以直接删除:
from PyPDF2 import PdfReader, PdfWriterreader = PdfReader("watermarked.pdf")writer = PdfWriter()for page in reader.pages: # 删除所有注释 if "/Annots" in page: del page["/Annots"] writer.add_page(page)with open("no_watermark.pdf", "wb") as f: writer.write(f)print("注释层水印已移除(如果存在)")
情况 2:转成图片后用图像处理去水印
把 PDF 每页转成图片,用 OpenCV 的 inpaint 功能去除水印区域,再转回 PDF。这种方法适合水印位置固定、颜色单一的情况,但会损失文字清晰度。
实际建议: 如果是你自己加水印的文件,保留原始无水印版本即可。如果是别人的文件需要去水印,先确认是否有版权问题,合法合规前提下可以尝试上述方法或使用专业 PDF 工具。
08 常见坑与解决方案
坑 1:加密后文件打不开
检查密码是否正确,以及加密算法是否被阅读器支持。老版本 Adobe Reader 可能不支持 AES-256 加密,改用 128 位加密兼容性更好。
坑 2:解密报错 "only algorithm code 1 and 2 are supported"
这是因为 PDF 使用了较新的加密算法(AES-256),PyPDF2 旧版本不支持。升级 PyPDF2 到最新版:pip install --upgrade PyPDF2。
坑 3:水印不显示
检查水印 PDF 的页面大小是否和目标 PDF 一致。如果目标 PDF 是 Letter 尺寸而水印是 A4,水印可能位置偏移。
坑 4:中文水印显示为方框
reportlab 默认字体不支持中文,必须注册中文字体,参考第 05 节的中文水印代码。
写在最后
加密和水印是 PDF 安全的两大手段。Python 能帮你批量完成这些操作,但要记住:技术是工具,合规是底线。解密他人文件、去除他人水印前,请确认你有合法权限。