当前位置:首页>python>【粉丝真实需求】外贸办公 Python 自动化・提单水印批量实战 5/6

【粉丝真实需求】外贸办公 Python 自动化・提单水印批量实战 5/6

  • 2026-09-05 05:50:05
【粉丝真实需求】外贸办公 Python 自动化・提单水印批量实战 5/6
点击上方“Python爬虫与数据挖掘”,进行关注

回复“书籍”即可获赠Python从入门到进阶共10本电子书

今

日

鸡

汤

不识庐山真面目,只缘身在此山中 。

前一阵子针对近期爆火的《给阿嬷的情书》电影写了一篇Python网络爬虫+数据分析文章,基于 Python 的《给阿嬷的情书》豆瓣短评文本挖掘与情感分析(附数据分析代码),当前阅读量已经突破1.2w了,是今年迄今为止本公众号阅读量最高的一篇文章。正是因为这篇文章的贡献,也让许多粉丝慕名前来,加上了好友。部分粉丝在工作和学习中,遇到了一些难题,提了一些自己的需求,我把需求也及时同步发布到我的接单群了。

前面的文章我们已经知悉了客户的真实业务需求,上一篇文章实战中我们历经8次失败,最终AI还建议我人工处理。好在我没有放弃,继续逮着豆包一顿调试。下面的是第九次调试记录。
豆包虐我千百遍,我待豆包如初恋。测试文件只是个单个样例,到时候客户肯定有批量文件,挨个人工肯定就麻烦了。会到第一篇文章赘述的那样,如果几十页、几百页,甚至上千页的人工替换,肯定费时费力费劲,急需Python救场。
言归正传,AI上面继续给我了一份新代码,从本地代码行数来看,确实比之前的多了一些,大约记得之前大概是80行左右的代码,这次直接飙到了120行左右。执行代码,运行后继续报错。紧接着继续开始下面的第十次调试。
这次继续报错了,跟我本地的WPS环境相关,把报错反馈给豆包后,继续开始第11次调试。
import osimport shutilimport zipfileimport win32com.clientimport subprocess# ===================== 配置区 =====================WORK_FOLDER = r"C:\Users\Desktop\new_project"OLD_TEXT = "Non-Negotiable"NEW_TEXT = "Original"TEMP_DOCX_FOLDER = "temp_docx_cache"# =================================================def kill_winword():    """强制结束WPS/Word后台进程,替代.Quit()"""    try:        subprocess.call(["taskkill", "/f", "/im", "WINWORD.EXE"], stdout=subprocess.PIPE, stderr=subprocess.PIPE)    except:        passdef doc_to_docx(doc_path, out_docx_path):    """第一步:单个doc转为docx(WPS兼容,无Quit)"""    word = win32com.client.Dispatch("Word.Application")    word.Visible = False    word.DisplayAlerts = 0    flag = False    try:        doc = word.Documents.Open(os.path.abspath(doc_path))        doc.SaveAs(os.path.abspath(out_docx_path), FileFormat=16)        doc.Close()        flag = True    except Exception as e:        print(f"❌ 转换失败 {doc_path}: {e}")    finally:        # 释放对象,杀进程替代Quit        del word        kill_winword()    return flagdef xml_replace_docx(docx_path, output_docx):    """第二步:XML底层替换docx水印(稳定100%命中艺术字)"""    temp_unzip = "tmp_unzip_single"    if os.path.exists(temp_unzip):        shutil.rmtree(temp_unzip)    os.mkdir(temp_unzip)    # 解压docx    with zipfile.ZipFile(docx_path, "r") as zf:        zf.extractall(temp_unzip)    # 全局替换所有xml文本    for root, _, files in os.walk(temp_unzip):        for fname in files:            if fname.endswith(".xml"):                fp = os.path.join(root, fname)                with open(fp, "r", encoding="utf-8") as f:                    content = f.read()                content = content.replace(OLD_TEXT, NEW_TEXT)                with open(fp, "w", encoding="utf-8") as f:                    f.write(content)    # 重新打包    with zipfile.ZipFile(output_docx, "w", zipfile.ZIP_DEFLATED) as new_zf:        for root, _, files in os.walk(temp_unzip):            for fname in files:                fp = os.path.join(root, fname)                rel_p = os.path.relpath(fp, temp_unzip)                new_zf.write(fp, rel_p)    shutil.rmtree(temp_unzip)    return Truedef docx_to_doc(docx_path, out_doc_path):    """第三步:替换完的docx转回原生doc格式(WPS兼容)"""    word = win32com.client.Dispatch("Word.Application")    word.Visible = False    word.DisplayAlerts = 0    flag = False    try:        doc = word.Documents.Open(os.path.abspath(docx_path))        doc.SaveAs(os.path.abspath(out_doc_path), FileFormat=0)        doc.Close()        flag = True    except Exception as e:        print(f"❌ 转回doc失败 {docx_path}: {e}")    finally:        del word        kill_winword()    return flagdef full_batch_pipeline():    # 初始化临时目录    if os.path.exists(TEMP_DOCX_FOLDER):        shutil.rmtree(TEMP_DOCX_FOLDER)    os.mkdir(TEMP_DOCX_FOLDER)    success_total = 0    fail_total = 0    # 遍历文件夹所有原始doc    for fname in os.listdir(WORK_FOLDER):        if fname.lower().endswith(".doc") and not fname.startswith("成品_"):            origin_doc = os.path.join(WORK_FOLDER, fname)            temp_docx = os.path.join(TEMP_DOCX_FOLDER, fname.replace(".doc", ".docx"))            replaced_docx = os.path.join(TEMP_DOCX_FOLDER, "mod_" + fname.replace(".doc", ".docx"))            final_doc = os.path.join(WORK_FOLDER, f"成品_{fname}")            print(f"\n===== 开始处理:{fname} =====")            # 步骤1 doc→docx            if not doc_to_docx(origin_doc, temp_docx):                fail_total +=1                continue            # 步骤2 XML替换水印            xml_replace_docx(temp_docx, replaced_docx)            # 步骤3 docx→doc            if docx_to_doc(replaced_docx, final_doc):                success_total +=1                print(f"✅ {fname} 流水线全部完成,输出:成品_{fname}")            else:                fail_total +=1    # 清理临时缓存    shutil.rmtree(TEMP_DOCX_FOLDER)    kill_winword()    print(f"\n==================== 批量汇总 ====================")    print(f"成功处理文件:{success_total} 个")    print(f"失败文件:{fail_total} 个")    print(f"成品文件统一带前缀「成品_」,原始doc完全保留未改动")if __name__ == "__main__":    full_batch_pipeline()
以上就是最终调试通过的代码。我自己本地看了下,应该没啥问题了,本地跑通了。最终的总结情况找豆包帮忙梳理了下,基本上如下。
.doc是二进制格式无法 XML 解析;WPS COM 对页眉艺术字的 Find 检索存在底层兼容 bug,无法捕获绘图内文本。后来我把最终调试好的代码,发给了客户验证,但是他在外边有事,不太方便。
应他的要求,我写了一份大概的操作步骤给他。
1、环境要求:Windows 系统 + 安装 Microsoft Word / WPS Office;2、先关闭所有 WPS/Word 窗口,任务管理器结束所有WINWORD.EXE进程;3、前置操作:老式.doc文件请先手动另存为.docx格式;4、使用方法:python代码和docx文档放同一文件夹,修改文件名后运行;5、安全保障:脚本不会修改原始文件,全部生成新文件,格式、内容、水印样式完整保留;6、如有报错,到时候发来看看,排查
本地验证无误,基本上也问题不大。
至此,客户的需求基本上完成了。没想到方法二前前后后调试了11次,终于搞定了。从需求开始到现在,一共两个可行的办法,看上去客户更加倾向于方法一,虽然要手动转一次格式。也许是因为他还没有尝试方法二,可能尝试方法二后,会更加倾向于方法二的。

今日鸡汤分享:因童心未泯,梦想才会继续长大,载着童心出发,驶向的每一程都是童话。祝大小朋友们节日快乐!

说明:我平时有正式工作,只做兼职副业,只接合理、合法、正规用途的需求,不接违法、违规、恶意攻击类项目。有需要的朋友可以直接留言。加了我微信后,我会自动发送一些自动回复,如有打扰,请忽略即可。那个都是我的微信,绝对是真人,你给我正常发消息即可,必回!

大家在学习过程中如果有遇到问题,欢迎随时联系我解决(我的vx:2584914241),应粉丝要求,我创建了一些高质量的Python学习交流群和付费接单群,欢迎大家加入我的Python学习交流群和接单群。

------------------- End -------------------

往期精彩文章推荐:

欢迎大家点赞,留言,转发,转载,感谢大家的相伴与支持

想加入Python学习群请在后台回复【入群】

万水千山总是情,点个【在看】行不行

最新文章

随机文章