当前位置:首页>python>Python PDF 自动化保姆级④:加密解密去密码,批量加水印去水印

Python PDF 自动化保姆级④:加密解密去密码,批量加水印去水印

  • 2026-10-11 05:26:01
Python PDF 自动化保姆级④:加密解密去密码,批量加水印去水印

前面三篇搞定了 PDF 的基础操作、文本提取和表格提取。今天进入第四个高频场景:安全与水印。

    职场中你一定遇到过:收到的 PDF 有密码打不开、需要给合同加水印防止泄露、批量给文件加密、忘记 PDF 密码…… 这些操作用 Adobe Acrobat 一个个弄,费时费力还容易出错。

今天用 Python 一次性搞定:加密、解密、去密码、加水印、去水印,全部支持批量。

01 PDF 加密:给文件加密码

PDF 支持两种密码:

用户密码(user password):打开文件时需要输入的密码。不知道密码连看都看不到。

所有者密码(owner password):控制权限的密码。可以打开文件,但限制打印、复制、编辑等操作。

用 PyPDF2 加密非常简单:

from PyPDF2 import PdfReader, PdfWriterinput_pdf = "document.pdf"output_pdf = "encrypted.pdf"user_password = "123456"   # 打开密码owner_password = "admin888" # 权限密码reader = PdfReader(input_pdf)writer = PdfWriter()for page in reader.pages:    writer.add_page(page)# 加密writer.encrypt(    user_password=user_password,    owner_password=owner_password,    use_128bit=True  # 使用128位加密)with open(output_pdf, "wb") as f:    writer.write(f)print(f"加密完成!输出文件: {output_pdf}")print(f"打开密码: {user_password}")

关键说明:

  1. use_128bit=True
     使用 128 位 AES 加密,安全性较高。如果需要兼容老版本 PDF 阅读器,可以设为 False 使用 40 位 RC4 加密。
  2. 只设 user_password 不设 owner_password 时,两者会使用同一个密码。
  3. 加密后的文件无法再用 PyPDF2 直接操作,需要先解密。

02 批量加密整个文件夹

from PyPDF2 import PdfReader, PdfWriterimport ospdf_dir = "./to_encrypt"output_dir = "./encrypted"password = "your_password"os.makedirs(output_dir, exist_ok=True)pdf_files = [f for f in os.listdir(pdf_dir) if f.lower().endswith(".pdf")]for filename in pdf_files:    input_path = os.path.join(pdf_dir, filename)    output_path = os.path.join(output_dir, filename)    try:        reader = PdfReader(input_path)        writer = PdfWriter()        for page in reader.pages:            writer.add_page(page)        writer.encrypt(user_password=password)        with open(output_path, "wb") as f:            writer.write(f)        print(f"✓ {filename} 加密成功")    except Exception as e:        print(f"✗ {filename} 失败: {str(e)}")print("\n批量加密完成!")

03 PDF 解密:去除密码

知道密码的情况下,去除密码非常简单:

from PyPDF2 import PdfReader, PdfWriterinput_pdf = "encrypted.pdf"output_pdf = "decrypted.pdf"password = "123456"reader = PdfReader(input_pdf)# 检查是否加密if reader.is_encrypted:    reader.decrypt(password)    print("密码验证成功,正在解密...")else:    print("该PDF未加密,无需解密")writer = PdfWriter()for page in reader.pages:    writer.add_page(page)with open(output_pdf, "wb") as f:    writer.write(f)print(f"解密完成!输出文件: {output_pdf}")

注意: 这里说的 "解密" 是指知道密码的情况下去除密码保护,不是暴力破解。暴力破解 PDF 密码在法律和道德上都有问题,本文不涉及。

04 批量解密:知道密码一键去除

from PyPDF2 import PdfReader, PdfWriterimport ospdf_dir = "./encrypted_files"output_dir = "./decrypted_files"password = "your_password"os.makedirs(output_dir, exist_ok=True)pdf_files = [f for f in os.listdir(pdf_dir) if f.lower().endswith(".pdf")]for filename in pdf_files:    input_path = os.path.join(pdf_dir, filename)    output_path = os.path.join(output_dir, filename)    try:        reader = PdfReader(input_path)        if reader.is_encrypted:            reader.decrypt(password)        writer = PdfWriter()        for page in reader.pages:            writer.add_page(page)        with open(output_path, "wb") as f:            writer.write(f)        print(f"✓ {filename} 解密成功")    except Exception as e:        print(f"✗ {filename} 失败: {str(e)}")print("\n批量解密完成!")

05 加水印:给 PDF 加上文字水印

水印是职场保护文档的常用手段。方案是:先用 reportlab 生成一个透明背景的水印 PDF,再用 PyPDF2 把水印叠加到每一页上。

第一步:生成水印 PDF

from reportlab.pdfgen import canvasfrom reportlab.lib.pagesizes import A4from reportlab.lib.colors import Colordef create_watermark(text, output="watermark.pdf"):    c = canvas.Canvas(output, pagesize=A4)    width, height = A4    # 设置字体和大小    c.setFont("Helvetica", 50)    # 设置颜色和透明度(灰色,30%不透明度)    c.setFillColor(Color(0.5, 0.5, 0.5, alpha=0.3))    # 旋转45度    c.saveState()    c.translate(width / 2, height / 2)    c.rotate(45)    # 绘制多行水印,覆盖整页    for y in range(-300, 400, 150):        for x in range(-400, 500, 300):            c.drawString(x, y, text)    c.restoreState()    c.save()    print(f"水印PDF已生成: {output}")create_watermark("CONFIDENTIAL 机密文件")

第二步:把水印叠加到 PDF 每一页

from PyPDF2 import PdfReader, PdfWriterinput_pdf = "document.pdf"watermark_pdf = "watermark.pdf"output_pdf = "watermarked.pdf"# 读取水印页watermark_reader = PdfReader(watermark_pdf)watermark_page = watermark_reader.pages[0]reader = PdfReader(input_pdf)writer = PdfWriter()for page in reader.pages:    # 把水印合并到当前页    page.merge_page(watermark_page)    writer.add_page(page)with open(output_pdf, "wb") as f:    writer.write(f)print(f"水印添加完成!输出文件: {output_pdf}")

中文水印处理: reportlab 默认不支持中文字体,需要注册中文字体。Windows 下可以用系统字体:

from reportlab.pdfgen import canvasfrom reportlab.lib.pagesizes import A4from reportlab.lib.colors import Colorfrom reportlab.pdfbase import pdfmetricsfrom reportlab.pdfbase.ttfonts import TTFont# 注册中文字体(Windows示例)pdfmetrics.registerFont(TTFont("SimSun", "C:/Windows/Fonts/simsun.ttc"))def create_watermark_cn(text, output="watermark_cn.pdf"):    c = canvas.Canvas(output, pagesize=A4)    width, height = A4    c.setFont("SimSun", 40)    c.setFillColor(Color(0.5, 0.5, 0.5, alpha=0.3))    c.saveState()    c.translate(width / 2, height / 2)    c.rotate(45)    for y in range(-300, 400, 150):        for x in range(-400, 500, 300):            c.drawString(x, y, text)    c.restoreState()    c.save()create_watermark_cn("内部资料 请勿外传")

06 批量加水印

from PyPDF2 import PdfReader, PdfWriterimport ospdf_dir = "./to_watermark"output_dir = "./watermarked"watermark_pdf = "watermark.pdf"os.makedirs(output_dir, exist_ok=True)watermark_page = PdfReader(watermark_pdf).pages[0]pdf_files = [f for f in os.listdir(pdf_dir) if f.lower().endswith(".pdf")]for filename in pdf_files:    input_path = os.path.join(pdf_dir, filename)    output_path = os.path.join(output_dir, filename)    try:        reader = PdfReader(input_path)        writer = PdfWriter()        for page in reader.pages:            page.merge_page(watermark_page)            writer.add_page(page)        with open(output_path, "wb") as f:            writer.write(f)        print(f"✓ {filename} 加水印成功")    except Exception as e:        print(f"✗ {filename} 失败: {str(e)}")print("\n批量加水印完成!")

07 去水印:能去掉吗?

先说结论:完美去水印几乎不可能。

原因:水印一旦通过 merge_page 叠加到 PDF 页面上,就和原页面内容融为一体了,无法区分哪些是水印、哪些是原文。就像在一张纸上盖了章,你没法把章的墨迹单独去掉。

但有几种特殊情况可以处理:

情况 1:水印是独立的注释层(Annotation)

有些 PDF 的水印是作为注释添加的,可以直接删除:

from PyPDF2 import PdfReader, PdfWriterreader = PdfReader("watermarked.pdf")writer = PdfWriter()for page in reader.pages:    # 删除所有注释    if "/Annots" in page:        del page["/Annots"]    writer.add_page(page)with open("no_watermark.pdf", "wb") as f:    writer.write(f)print("注释层水印已移除(如果存在)")

情况 2:转成图片后用图像处理去水印

把 PDF 每页转成图片,用 OpenCV 的 inpaint 功能去除水印区域,再转回 PDF。这种方法适合水印位置固定、颜色单一的情况,但会损失文字清晰度。

实际建议: 如果是你自己加水印的文件,保留原始无水印版本即可。如果是别人的文件需要去水印,先确认是否有版权问题,合法合规前提下可以尝试上述方法或使用专业 PDF 工具。

08 常见坑与解决方案

坑 1:加密后文件打不开

检查密码是否正确,以及加密算法是否被阅读器支持。老版本 Adobe Reader 可能不支持 AES-256 加密,改用 128 位加密兼容性更好。

坑 2:解密报错 "only algorithm code 1 and 2 are supported"

这是因为 PDF 使用了较新的加密算法(AES-256),PyPDF2 旧版本不支持。升级 PyPDF2 到最新版:pip install --upgrade PyPDF2。

坑 3:水印不显示

检查水印 PDF 的页面大小是否和目标 PDF 一致。如果目标 PDF 是 Letter 尺寸而水印是 A4,水印可能位置偏移。

坑 4:中文水印显示为方框

reportlab 默认字体不支持中文,必须注册中文字体,参考第 05 节的中文水印代码。

写在最后

加密和水印是 PDF 安全的两大手段。Python 能帮你批量完成这些操作,但要记住:技术是工具,合规是底线。解密他人文件、去除他人水印前,请确认你有合法权限。

最新文章

随机文章