📌 引入:为什么药管人也要学LDA?
嗨,各位药管的同学们好呀 👋
不知道大家有没有遇到过这些场景:
- 📚 导师说"你把这个领域的文献都梳理一遍",你一看,CNKI上搜出来 800+ 篇,一篇篇读怕是要读到毕业……
- 💬 导师又说"你去看看患者对集采政策的评论",你爬下来 5000 条评论,难道要一条条看?
- 📜 导师再说"你把近五年药品监管政策文本做个量化分析",你看着 200 份政策文件 陷入沉思……
别慌!今天教大家一个"文本挖掘神器"——LDA主题模型,用 Python 就能跑起来,帮你从海量文本中 自动发现隐藏的主题结构。
简单来说:你给它一堆文档,它告诉你这些文档主要在聊什么。
而且今天这篇教程,不需要你有任何编程基础,代码直接复制粘贴就能运行。走起!🚀
📖 一、LDA原理:30秒搞懂
1.1 一个比喻:图书馆分类 📚
想象你是一个新来的图书管理员,面前有一大堆没有分类标签的书。你怎么把它们分好类?
你的做法可能是这样的:
- 翻开每本书,看里面哪些词出现得最多(比如一本书反复出现"成本""效果""医保",那大概率是药物经济学的)
- 同一类的书应该有相似的关键词组合(药物经济学的书都爱出现"成本效果""QALY""增量比"这些词)
LDA干的就是这个活儿! 只不过它不是人工翻书,而是用概率统计来自动完成这个过程。
1.2 三个核心概念
1.3 一句话原理
LDA假设每篇文档是由多个主题混合而成的,每个主题又由一组关键词以不同概率构成。通过迭代学习,LDA能同时"反推"出文档的主题分布和主题的关键词分布。
数学上这叫"贝叶斯推断",你暂时不用管公式,先把代码跑起来再说 😄
💻 二、Python实战:手把手教你跑LDA
2.1 环境准备
首先,你需要安装几个 Python 库。打开命令行(Windows 用户按 Win+R 输入 cmd),粘贴以下命令:
pip install gensim jieba pyLDAvis pandas numpy
💡 小提示:如果你还没安装 Python,推荐安装 Anaconda(一个 Python 集成环境),去 Anaconda官网 下载即可,装好后上面的命令在 Anaconda Prompt 里运行。
2.2 完整代码
下面是完整的代码。你不需要改任何东西,直接复制粘贴到一个 .py 文件里运行就行。
代码里用了 30 条模拟的药学文献摘要,涵盖了药物经济学、药品监管、药物警戒、合理用药、药品流通五个方向,所以你可以直接看到五个主题被识别出来。
第一部分:导入库 + 准备数据
# -*- coding: utf-8 -*-"""LDA主题模型 Python实战脚本药管圈 · 技能加油包运行前请先安装依赖:pip install gensim jieba pyLDAvis pandas numpy"""import jiebaimport pandas as pdimport numpy as npfrom gensim import corporafrom gensim.models import LdaModel, CoherenceModelimport pyLDAvisimport pyLDAvis.gensim_models as gensimvis
这段代码做了什么呢?
gensim:LDA 主题模型的核心库,NLP 领域的瑞士军刀 🔧
接下来是 30 条模拟药学文献摘要,涵盖五个方向:
# ==================== 1. 构造模拟药学文献摘要 ====================abstracts = [# --- 药物经济学相关 ---"目的:评估某新型抗肿瘤药物的成本效果分析,采用马尔可夫模型进行药物经济学评价,测算质量调整生命年与增量成本效果比。","基于卫生技术评估方法,对三种降压药进行成本效用分析,结果显示新型药物具有较高的经济性,医保支付标准应予以考虑。","本研究运用成本效益分析方法,比较仿制药与原研药在治疗糖尿病中的经济学优势,为药品价格谈判提供循证依据。","通过构建决策树模型,评估免疫检查点抑制剂在非小细胞肺癌治疗中的成本效果,敏感度分析表明结果稳健。","药品集中带量采购政策实施后,对中选药品进行药物经济学再评价,分析价格下降对成本效果比的影响。","采用最小成本分析法比较两种抗感染治疗方案,结合医保目录调整背景讨论药品经济性评价的临床意义。",# --- 药品监管相关 ---"国家药品监督管理局发布新的药品注册管理办法,简化审批流程,加快创新药上市速度,促进医药产业高质量发展。","药品上市许可持有人制度实施效果评价:基于监管数据分析持有人变更情况和药品质量安全责任落实。","仿制药一致性评价政策进展与挑战分析,探讨参比制剂选择、生物等效性试验要求和评价结果应用。","药品审评审批制度改革对创新药研发激励效应的实证研究,分析优先审评和突破性治疗药物程序。","国际药品监管协同机制比较研究,对比FDA、EMA和NMPA在药品加速审批路径上的异同。","药品追溯体系建设与监管创新:基于区块链技术的药品全生命周期监管模式探索。",# --- 药物警戒相关 ---"基于自发报告系统的药品不良反应信号检测方法比较研究,分析比例报告比和贝叶斯方法在信号挖掘中的应用。","某医院药品不良反应监测数据分析:报告类型分布、涉及药品类别和累及器官系统的统计分析。","药物警戒体系下的风险沟通机制研究,探讨药品安全警示信息的发布渠道和公众认知效果。","真实世界数据在药物警戒中的应用:基于电子病历的药品安全信号主动监测方法。","上市后药品安全性再评价:某中药注射剂不良反应文献计量分析与风险因素挖掘。","国际药物警戒信号检测方法学进展:从传统统计学方法到机器学习算法的演变。",# --- 合理用药相关 ---"处方点评制度在促进合理用药中的作用分析:基于某三甲医院抗菌药物专项点评数据的回顾性研究。","临床药师干预对住院患者不合理用药的影响评价,采用前后对照研究设计分析处方合格率变化。","某区域基层医疗机构基本药物合理使用情况调查分析,重点关注处方规范性和用药适宜性。","DRG支付方式改革背景下合理用药管理策略探讨:基于病组用药路径和费用控制的实践。","老年患者多重用药风险评估与管理:基于药物相关性问题和处方精简策略的综述。","抗菌药物分级管理与合理用药:某医院实施分级管理前后抗菌药物使用强度和耐药率变化分析。",# --- 药品流通相关 ---"药品流通供应链管理优化研究:基于冷链物流温控监测数据的药品质量保障分析。","两票制政策对药品流通行业格局的影响:药品批发企业整合趋势与流通效率评价。","互联网药品销售监管问题研究:线上售药平台合规性分析与监管对策建议。","药品集中采购平台运营模式比较与优化路径研究,分析平台功能、采购效率和价格发现机制。","基层药品配送保障机制研究:偏远地区药品可及性与配送及时性影响因素分析。","医药电商发展现状与趋势分析:处方药网售政策放开后的市场格局变化与监管挑战。",]doc_ids = [f"DOC_{i+1:02d}"for i in range(len(abstracts))]
💡 为什么用模拟数据? 这样你不用去找数据就能直接跑通代码。等你学会了方法,把自己的文献摘要替换掉 abstracts 列表就行!
第二部分:添加药学专业术语 + 停用词表
这一步非常关键!因为 jieba 默认的分词词典里可能没有药学专业术语,比如它会把"药物经济学"切成"药物 / 经济学",这就破坏了语义完整性。所以我们要 手动把这些词加进去:
# ==================== 2. 添加专业术语到jieba词典 ====================jieba.add_word("药物经济学")jieba.add_word("药品不良反应")jieba.add_word("集中带量采购")jieba.add_word("上市许可持有人")jieba.add_word("成本效果分析")jieba.add_word("成本效用分析")jieba.add_word("成本效益分析")jieba.add_word("质量调整生命年")jieba.add_word("增量成本效果比")jieba.add_word("马尔可夫模型")jieba.add_word("决策树模型")jieba.add_word("敏感度分析")jieba.add_word("卫生技术评估")jieba.add_word("医保支付标准")jieba.add_word("药品注册管理")jieba.add_word("仿制药一致性评价")jieba.add_word("生物等效性")jieba.add_word("优先审评")jieba.add_word("突破性治疗药物")jieba.add_word("药品追溯体系")jieba.add_word("自发报告系统")jieba.add_word("信号检测")jieba.add_word("药物警戒")jieba.add_word("风险沟通")jieba.add_word("真实世界数据")jieba.add_word("电子病历")jieba.add_word("处方点评")jieba.add_word("合理用药")jieba.add_word("临床药师")jieba.add_word("抗菌药物分级管理")jieba.add_word("多重用药")jieba.add_word("处方精简")jieba.add_word("两票制")jieba.add_word("药品流通")jieba.add_word("冷链物流")jieba.add_word("互联网药品销售")jieba.add_word("药品集中采购")
然后是 停用词表——就是那些"没什么信息量、到处都是"的词,比如"的""了""在"。这些词会干扰模型识别真正的主题关键词,所以要过滤掉:
# ==================== 3. 停用词表 ====================stopwords = set(["的", "了", "在", "是", "和", "与", "对", "为", "及", "以","基于", "通过", "采用", "进行", "分析", "研究", "方法","目的", "结果", "结论", "某", "本研究", "本文", "探讨","比较", "某三甲医院", "某区域", "某医院","并", "或", "等", "从", "到", "中", "上", "下", "后","前", "其", "该", "此", "这些", "那些", "一个","可以", "能够", "应该", "需要", "具有", "存在", "发生","新型", "情况", "变化", "趋势", "影响", "评价", "基于","制度", "实施", "效果", "数据", "相关", "因素", "机制","路径", "体系", "模式", "策略", "现状", "挑战", "进展",])
⚠️ 注意:停用词表里有一些看起来"有用"的词,比如"分析""研究""评价"。这是因为在 LDA 里,这些词几乎 每篇文档都会出现,反而没法区分不同主题,所以要过滤掉。这个思路大家要理解。
接下来是分词函数:
deftokenize(text):"""jieba分词 + 去停用词 + 去单字""" words = jieba.lcut(text) words = [w for w in words if len(w) > 1and w notin stopwords]return words
很简单对吧?就是三步:切词 → 去掉停用词 → 去掉单字(单个字的词信息量太低)。
第三部分:计算不同主题数下的Coherence Score
这一步是 选 K(主题数) 的关键。我们不能拍脑袋说"就用5个主题",而是要让数据告诉我们最佳主题数是多少。
怎么判断?用一个叫 Coherence Score 的指标。简单来说,**它衡量的是一个主题里的关键词在语义上有多"连贯"**。分数越高,说明主题内的词越"像是一回事",主题质量越好 🎯
defcompute_coherence_values(dictionary, corpus, texts, limit, start=2, step=1):"""计算不同主题数的Coherence Score""" coherence_values = [] model_list = []for num_topics in range(start, limit + 1, step): model = LdaModel( corpus=corpus, id2word=dictionary, num_topics=num_topics, random_state=42, passes=20, iterations=400, alpha='auto', eta='auto' ) model_list.append(model) coherencemodel = CoherenceModel( model=model, texts=texts, dictionary=dictionary, coherence='c_v', processes=1# Windows下用单进程避免multiprocessing报错 ) coherence_values.append(coherencemodel.get_coherence()) print(f" 主题数={num_topics}, Coherence Score={coherencemodel.get_coherence():.4f}")return model_list, coherence_values
💡 Windows 用户注意:processes=1 这行很重要!Windows 下的多进程机制和 Linux 不一样,不改的话可能会报 multiprocessing 相关的错误。
几个参数解释一下:
| |
|---|
random_state=42 | |
passes=20 | |
iterations=400 | |
alpha='auto' | |
eta='auto' | |
第四部分:主程序——把一切串起来
# ==================== 主程序入口 ====================if __name__ == '__main__':# 分词与预处理 texts = [tokenize(doc) for doc in abstracts]# 构建词典和语料库 dictionary = corpora.Dictionary(texts) dictionary.filter_extremes(no_below=2, no_above=0.8, keep_n=5000)# 构建Bag-of-Words语料 corpus = [dictionary.doc2bow(text) for text in texts] print(f"文档数: {len(corpus)} | 词汇表大小: {len(dictionary)}") print(f"分词示例(第1篇): {texts[0]}") print()
这里有几个新概念:
- Dictionary(词典):把所有出现过的词编号,建一个"词→编号"的映射表
- filter_extremes:过滤掉太稀有的词(出现不到2次)和太常见的词(超过80%的文档都有),减少噪声
- doc2bow:把每篇文档转换成"词编号: 词频"的格式,也就是 Bag-of-Words 表示
然后选择最佳主题数:
# ==================== 4. 主题数选择(Coherence Score) ==================== print("=" * 50) print("计算不同主题数的Coherence Score...") print("=" * 50) model_list, coherence_values = compute_coherence_values( dictionary, corpus, texts, limit=10, start=2, step=1 ) best_idx = np.argmax(coherence_values) best_k = best_idx + 2# start=2 print(f"\n最佳主题数: {best_k} (Coherence Score={coherence_values[best_idx]:.4f})") print()
这段代码会从 2 个主题试到 10 个主题,画出"主题数 vs. Coherence Score"的变化趋势。得分最高的那个主题数就是最佳选择。
接下来训练最终的 LDA 模型:
# ==================== 5. 训练最终LDA模型 ==================== K = 5# 选择5个主题(与模拟数据的五个方向对应) lda_model = LdaModel( corpus=corpus, id2word=dictionary, num_topics=K, random_state=42, passes=30, iterations=500, alpha='auto', eta='auto', chunksize=100, eval_every=None )
💡 这里 K=5 是因为我们 事先知道 模拟数据有五个方向。实际使用时,你应该根据上一步 Coherence Score 的结果来决定 K 值。
第五部分:查看结果 + 可视化
# ==================== 6. 查看主题关键词 ==================== print("=" * 50) print("各主题Top 10关键词:") print("=" * 50)for idx in range(K): topic_words = lda_model.show_topic(idx, topn=10) words_str = ", ".join([f"{w}({p:.3f})"for w, p in topic_words]) print(f" Topic {idx + 1}: {words_str}") print()
这一步会输出每个主题的 Top 10 关键词及其权重。你会看到类似这样的结果:
Topic 1: 成本效果(0.035), 马尔可夫(0.030), 药物经济学(0.028), ...Topic 2: 药品注册(0.032), 上市许可(0.029), 仿制药(0.027), ......
这就是 LDA 从文本中"学"出来的主题结构!
# ==================== 7. 文档-主题分布 ==================== print("=" * 50) print("各文档的主题分布(主导主题):") print("=" * 50) doc_topics = []for i, doc_bow in enumerate(corpus): topic_dist = lda_model.get_document_topics(doc_bow, minimum_probability=0.0) topic_dist = sorted(topic_dist, key=lambda x: x[1], reverse=True) dominant_topic = topic_dist[0][0] + 1 doc_topics.append({"Doc": doc_ids[i],"Dominant_Topic": dominant_topic,"Topic_Prob": round(topic_dist[0][1], 4) }) df_topics = pd.DataFrame(doc_topics) print(df_topics.to_string(index=False)) print()
这段代码会告诉你:每篇文档最可能被归到哪个主题,以及归属的概率是多少。 比如输出可能长这样:
DOC_01 Dominant_Topic=1 Topic_Prob=0.82 DOC_07 Dominant_Topic=2 Topic_Prob=0.75
这说明 DOC_01 有 82% 的概率属于主题1(药物经济学),DOC_07 有 75% 的概率属于主题2(药品监管)。
最后,生成漂亮的交互式可视化图:
# ==================== 8. pyLDAvis可视化 ====================try: print("=" * 50) print("生成交互式可视化...") print("=" * 50) vis_data = gensimvis.prepare(lda_model, corpus, dictionary, n_jobs=1) output_html = "lda_vis.html" pyLDAvis.save_html(vis_data, output_html) print(f"可视化已保存为 {output_html},请在浏览器中打开查看")except Exception as e: print(f"可视化生成失败(pyLDAvis可能未安装): {e}") print("可跳过可视化,前面结果已足够参考") print() print("运行完毕!")
💡 pyLDAvis 会生成一个 HTML 文件,用浏览器打开就能看到 气泡图——每个气泡代表一个主题,气泡大小代表主题的权重,气泡之间的距离代表主题的相似度。鼠标悬停还能看到每个主题的关键词分布,非常直观!
🔍 三、结果解读:跑出来之后怎么看?
3.1 主题数怎么选?
这是大家最常问的问题。三种方法供参考:
| | |
|---|
| Coherence Score | | |
| 肘部法则 | 画主题数 vs. perplexity(困惑度)的图,找拐点 | |
| 业务判断 | | |
💡 经验之谈:不要只看 Coherence Score 最高就完事。有时候分数最高的方案,主题关键词看起来"说不通",这时候就应该选一个分数稍低但语义更清晰的方案。数据为业务服务,不是反过来。
3.2 主题怎么命名?
LDA 只会告诉你"主题1的关键词是:成本效果、马尔可夫、药物经济学……",但不会告诉你这个主题叫什么名字。
命名需要你 根据关键词的含义,结合专业知识来概括。比如:
⚠️ 注意:命名是一件 需要专业判断 的事情,不同的命名者可能会给出不同的名称,这很正常。关键是命名要 有依据(能对应上关键词),而不是随便起。
⚠️ 四、避坑指南:5个常见坑
根据我自己踩过的坑和同学们反馈的问题,总结了5个最常见的坑:
坑1:分词质量差 💥
现象:主题关键词里出现大量"无意义"的词,或者专业术语被错误切分。
解决:
- 一定要用
jieba.add_word() 添加专业术语!这是药学文本处理的 第一要务 - 跑完分词后,先打印几条分词结果 人工检查,确认专业术语没被切碎
- 可以考虑加载自定义词典文件:
jieba.load_userdict("pharma_dict.txt")
坑2:停用词表不完善 💥
现象:主题关键词里全是"研究""分析""方法"这种泛化词汇。
解决:
- 跑完第一轮后,看看高频词里有没有"看起来没用"的词,有就加进停用词表
- 停用词表是一个 迭代优化 的过程,不是一次就搞定的
- 可以参考哈工大停用词表作为基础,再根据自己的领域添加
坑3:主题数 K 选不好 💥
现象:K 太小,所有文档都被归到一两个大杂烩主题里;K 太大,出现很多"只有三四篇文档"的小主题。
解决:
- 先用 Coherence Score 自动搜索,再 人工检查 每个主题的关键词是否有意义
- 一般建议 K 在 3-15 之间,太少太多都不太合理
坑4:数据量太少 💥
现象:LDA 本质上是统计模型,数据太少(< 50 篇)结果会非常不稳定。
解决:
- 如果数据实在不够,可以考虑用 BERTopic(基于大语言模型的主题模型),对小数据集更友好
坑5:忽略随机种子的影响 💥
现象:每次跑出来的结果不一样,不知道哪次是"对"的。
解决:
- **一定要设
random_state=42**(或者任意固定数字),保证结果可复现 - 如果不确定结果是否稳定,可以换不同的随机种子多跑几次,看主题结构是否一致
- 代码里已经设了
random_state=42,大家不用改
💊 五、药管应用建议:LDA能用在哪?
作为药管人,LDA 的应用场景其实非常多。下面列5个最常见的方向:
| | | |
|---|
| 文献综述辅助 | | | |
| 患者评论挖掘 | | 发现患者最关注的用药问题维度(疗效?副作用?价格?) | |
| 政策文本分析 | | 量化分析政策重心的演变趋势(如近十年药品监管政策主题变迁) | |
| 药品不良反应信号 | | | |
| 课程反馈分析 | | | |
🎯 实操建议
- 数据获取:CNKI 的摘要可以通过 CNKI 导出功能批量获取(选择"摘要"格式),保存为 txt 或 csv 文件
- 替换数据:把代码中的
abstracts 列表替换成你自己的数据就行,其他代码基本不用改 - 专业术语词典:每个研究方向的专业术语不一样,记得根据自己的领域调整
jieba.add_word() 的内容 - 结果呈现:在论文中展示 LDA 结果时,通常用"主题关键词表 + 主题分布图"的组合,pyLDAvis 的气泡图也可以截图放进去
- 结合质性分析:LDA 是量化方法,但它发现的主题结构可以作为你质性分析的"骨架",两者结合更有说服力
📝 六、总结
今天我们学了:
✅ LDA 是什么:一种从文本中自动发现主题结构的统计模型
✅ 怎么用 Python 跑:jieba 分词 + gensim LDA + pyLDAvis 可视化,三步搞定
✅ 结果怎么看:Coherence Score 选 K,关键词语义来命名
✅ 哪些坑要避:分词、停用词、主题数、数据量、随机种子
LDA 不是万能的,但它确实是一个 快速了解大量文本全貌 的好工具。对于做文献综述、政策分析、评论挖掘的药管同学来说,掌握它能帮你省下大量的阅读时间 ⏰
代码直接复制就能跑,不用改任何东西。先把模拟数据跑通,再替换成自己的数据,这就是最高效的学习路径!
如果跑代码过程中遇到问题,欢迎在公众号留言区提问,我们一起交流 💪
📚 参考文献
[1] Blei D M, Ng A Y, Jordan M I. Latent Dirichlet Allocation[J]. Journal of Machine Learning Research, 2003, 3: 993-1022. (LDA 原始论文,经典中的经典) 🔗 http://www.jmlr.org/papers/v3/blei03a.html
[2] Řehůřek R, Sojka P. Software Framework for Topic Modelling with Large Corpora[C]. Proceedings of the LREC 2010 Workshop on New Perspectives for NLP, 2010: 45-50. (gensim 库的作者论文) 🔗 https://radimrehurek.com/gensim/lrec2010_final.pdf
[3] Sievert C, Shirley K. LDAvis: A Method for Visualizing and Interpreting Topics[C]. Proceedings of the Workshop on Interactive Language Learning, Visualization, and Interfaces, 2014: 63-70. (pyLDAvis 可视化方法论文) 🔗 https://nlp.stanford.edu/events/llvi2014/papers/sievert-llvi2014.pdf
[4] Mimno D, Wallach H M, Talley E, et al. Optimizing Semantic Coherence in Topic Models[C]. Proceedings of the 2011 Conference on Empirical Methods in Natural Language Processing, 2011: 262-272. (Coherence Score 的方法论基础) 🔗 https://aclanthology.org/D11-1024/
[5] 孙盟, 等. 主题模型在中文文本分析中的应用研究综述[J]. 情报工程, 2020, 6(2): 71-84. 🔗 https://kns.cnki.net (搜索"主题模型 中文文本分析"可获取)
[6] gensim 官方文档. LDA Topic Modelling. 🔗 https://radimrehurek.com/gensim/auto_examples/tutorials/run_lda.html
免责声明:本文代码和内容为学习交流目的,仅供同学参考学习使用。如有不妥之处,欢迎联系指正。